GLM-4.7-Flash — le modèle GLM léger à 30B

GLM-4.7-Flash est le membre à 30 milliards de paramètres de la famille de modèles GLM, conçu pour les cas où le vaisseau amiral ne tient tout simplement pas. Trente milliards de paramètres, c'est la classe de taille qui tourne sur un seul accélérateur à grande mémoire, ou quantifiée sur du matériel grand public : le choix naturel pour le développement local, l'inférence sur site et tout ce où la latence par requête compte plus que les derniers points de benchmark.

Les auteurs du modèle le positionnent comme efficace et performant, et annoncent qu'il devance les modèles open source d'échelle comparable. C'est l'affirmation pertinente pour ce palier : personne qui déploie un modèle de 30B n'attend qu'il batte un système de frontière, mais tout le monde tient à savoir s'il bat les autres options de 30B qu'il aurait pu faire tourner à la place.

30B
paramètres
la classe de taille qui tient sur un seul accélérateur
MIT
licence open source
MIT, sans restriction régionale
4.7
génération de la série
le palier léger de la lignée GLM-4.7

Playground IA gratuit — testez un LLM open source en direct

Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.

La réponse s'affichera ici en streaming...

Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.

Pourquoi un modèle GLM de 30B a sa place

Le nombre de paramètres décide de l'endroit où un modèle peut physiquement tourner, et cette contrainte pilote plus de décisions d'architecture que la capacité brute. Un modèle de 30B peut être servi sur du matériel qu'une petite équipe possède déjà, garde les prompts à l'intérieur de votre réseau et répond assez vite pour s'insérer dans une boucle interactive plutôt que dans une file de traitement par lots. C'est aussi la taille à partir de laquelle le fine-tuning cesse d'être un projet de recherche — vous pouvez adapter un modèle GLM de 30B à un domaine étroit et en évaluer le résultat dans l'après-midi. Le compromis est réel : moins de paramètres signifie moins de marge sur le raisonnement difficile et de longue haleine, précisément la charge de travail pour laquelle le vaisseau amiral à contexte 1M a été conçu. La bonne façon d'utiliser la famille est d'aiguiller le travail selon sa difficulté, en gardant les tâches bon marché et à fort volume sur Flash et en réservant le vaisseau amiral aux problèmes qui le justifient vraiment.

Paramètres
30B
Licence
Open source MIT
Positionnement
Léger, haut débit
Famille
Série GLM-4.7
Hébergement des poids
HuggingFace · ModelScope

GLM-4.7-Flash dans les données de benchmark publiées

Le tableau comparatif publié couvre GLM-5.2 et GLM-5.1. La colonne ci-dessous est celle de GLM-5.1, montrée uniquement comme point de repère pour la famille. Aucune colonne de benchmarks n'a été publiée pour GLM-4.7-Flash, et aucune n'est estimée ici.

Il n'existe pas de ligne publiée pour GLM-4.7-Flash, et en déduire une à partir d'un modèle bien plus grand serait trompeur dans un sens comme dans l'autre. La colonne de référence sert au calibrage : elle montre l'étendue occupée par les modèles GLM publiés, de sorte que vous sachiez ce qu'un modèle pleine taille de la génération précédente atteignait avant de décider si un modèle de 30B suffira à votre tâche.

Voir en détail les 17 benchmarks GLM →

Comment la famille se compare sur la programmation de longue haleine

Comparaison sur DeepSWE, telle que publiée par les auteurs du modèle.

DeepSWE est l'endroit où l'échelle du modèle se voit le plus brutalement. GPT-5.5 mène à 70.0 et Claude Opus 4.8 affiche 58.0, GLM-5.2 atteint 46.2, et la génération ouverte précédente se regroupe bien en dessous — GLM-5.1 et Qwen3.7-Max à 18.0, DeepSeek-V4-Pro à 8.0. Si votre charge de travail ressemble à DeepSWE, un modèle léger est le mauvais outil, aussi efficace soit-il ; si elle ressemble à de la classification, de l'extraction ou des modifications de code de routine, Flash vous suffira probablement.

Lire la comparaison complète GLM vs Qwen →

La place de GLM-4.7-Flash dans la gamme des modèles GLM

GLM-4.7-Flash est le palier léger de la génération GLM-4.7, aux côtés du GLM-4.7 pleine taille et au-dessus du plus ancien GLM-4.5-Air dans la lignée efficacité de la famille. Tout dans cette lignée porte la même licence MIT et les mêmes hébergeurs de poids : passer d'un palier à l'autre est une décision matérielle, pas juridique.

Autres modèles GLM

Tout voir

FAQ GLM-4.7-Flash

Qu'est-ce que le modèle GLM-4.7-Flash ?
GLM-4.7-Flash est le membre léger à 30 milliards de paramètres de la famille de modèles GLM. Il est sous licence MIT avec des poids ouverts, conçu pour une inférence efficace à haut débit, et les auteurs du modèle annoncent qu'il devance les modèles open source d'échelle comparable.
Quel matériel faut-il pour exécuter GLM-4.7-Flash ?
Trente milliards de paramètres, c'est la classe de taille qui tient sur un seul accélérateur à grande mémoire en précision réduite, ou sur du matériel grand public une fois quantifié. Les besoins exacts dépendent de votre quantification, de la longueur de contexte et du framework de service : mesurez avec votre propre configuration plutôt que de vous fier à une règle empirique.
GLM-4.7-Flash dispose-t-il de scores de benchmark publiés ?
Pas dans le tableau comparatif publié par les auteurs du modèle, qui couvre GLM-5.2 et GLM-5.1. Ce site n'estime pas de colonne pour lui. L'affirmation publiée pour ce modèle est relative : il est annoncé comme devançant les modèles ouverts d'échelle comparable.
GLM-4.7-Flash est-il open source ?
Oui. C'est un modèle GLM à poids ouverts sous licence MIT, publié sur HuggingFace et ModelScope sans restriction régionale, et il fonctionne sur transformers, vLLM, SGLang, xLLM et ktransformers comme le reste de la famille.
GLM-4.7-Flash ou GLM-4.5-Air ?
Flash est le palier léger le plus récent et porte les améliorations de programmation et de raisonnement de la génération GLM-4.7 ; Air est le jalon d'efficacité antérieur. Aucun des deux n'a de colonne de benchmarks publiée : si tous deux tiennent sur votre matériel, la démarche sensée est de les évaluer sur votre propre tâche plutôt que sur leur positionnement.

Testez un modèle d'IA en direct, gratuitement et sans compte

Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.