GLM-4.7-Flash est le membre à 30 milliards de paramètres de la famille de modèles GLM, conçu pour les cas où le vaisseau amiral ne tient tout simplement pas. Trente milliards de paramètres, c'est la classe de taille qui tourne sur un seul accélérateur à grande mémoire, ou quantifiée sur du matériel grand public : le choix naturel pour le développement local, l'inférence sur site et tout ce où la latence par requête compte plus que les derniers points de benchmark.
Les auteurs du modèle le positionnent comme efficace et performant, et annoncent qu'il devance les modèles open source d'échelle comparable. C'est l'affirmation pertinente pour ce palier : personne qui déploie un modèle de 30B n'attend qu'il batte un système de frontière, mais tout le monde tient à savoir s'il bat les autres options de 30B qu'il aurait pu faire tourner à la place.
Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.
La réponse s'affichera ici en streaming...
Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.
Le nombre de paramètres décide de l'endroit où un modèle peut physiquement tourner, et cette contrainte pilote plus de décisions d'architecture que la capacité brute. Un modèle de 30B peut être servi sur du matériel qu'une petite équipe possède déjà, garde les prompts à l'intérieur de votre réseau et répond assez vite pour s'insérer dans une boucle interactive plutôt que dans une file de traitement par lots. C'est aussi la taille à partir de laquelle le fine-tuning cesse d'être un projet de recherche — vous pouvez adapter un modèle GLM de 30B à un domaine étroit et en évaluer le résultat dans l'après-midi. Le compromis est réel : moins de paramètres signifie moins de marge sur le raisonnement difficile et de longue haleine, précisément la charge de travail pour laquelle le vaisseau amiral à contexte 1M a été conçu. La bonne façon d'utiliser la famille est d'aiguiller le travail selon sa difficulté, en gardant les tâches bon marché et à fort volume sur Flash et en réservant le vaisseau amiral aux problèmes qui le justifient vraiment.
Le tableau comparatif publié couvre GLM-5.2 et GLM-5.1. La colonne ci-dessous est celle de GLM-5.1, montrée uniquement comme point de repère pour la famille. Aucune colonne de benchmarks n'a été publiée pour GLM-4.7-Flash, et aucune n'est estimée ici.
Il n'existe pas de ligne publiée pour GLM-4.7-Flash, et en déduire une à partir d'un modèle bien plus grand serait trompeur dans un sens comme dans l'autre. La colonne de référence sert au calibrage : elle montre l'étendue occupée par les modèles GLM publiés, de sorte que vous sachiez ce qu'un modèle pleine taille de la génération précédente atteignait avant de décider si un modèle de 30B suffira à votre tâche.
Comparaison sur DeepSWE, telle que publiée par les auteurs du modèle.
DeepSWE est l'endroit où l'échelle du modèle se voit le plus brutalement. GPT-5.5 mène à 70.0 et Claude Opus 4.8 affiche 58.0, GLM-5.2 atteint 46.2, et la génération ouverte précédente se regroupe bien en dessous — GLM-5.1 et Qwen3.7-Max à 18.0, DeepSeek-V4-Pro à 8.0. Si votre charge de travail ressemble à DeepSWE, un modèle léger est le mauvais outil, aussi efficace soit-il ; si elle ressemble à de la classification, de l'extraction ou des modifications de code de routine, Flash vous suffira probablement.
GLM-4.7-Flash est le palier léger de la génération GLM-4.7, aux côtés du GLM-4.7 pleine taille et au-dessus du plus ancien GLM-4.5-Air dans la lignée efficacité de la famille. Tout dans cette lignée porte la même licence MIT et les mêmes hébergeurs de poids : passer d'un palier à l'autre est une décision matérielle, pas juridique.
Le vaisseau amiral à contexte d'1M de tokens. Il représente l'état de l'art open source sur les évaluations de programmation et de longue haleine, avec des niveaux d'effort explicites Non-Thinking, High et Max.
Le jalon d'efficacité originel de la famille : un modèle GLM à faible empreinte offrant de solides performances pour chaque unité de calcul consommée.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.