GLM-4.7 est le modèle GLM qui a fait de la programmation la capacité phare de la famille. Il apportait une génération de code renforcée, un raisonnement multi-étapes stable, une meilleure gestion des tâches d'agent complexes, un dialogue plus naturel et une esthétique front-end visiblement améliorée — ce dernier point comptant plus qu'il n'y paraît, car un modèle qui écrit du code d'interface crédible épargne une catégorie de travail manuel que les benchmarks purement back-end ne capturent jamais.
Il se situe juste avant la série 5 dans la lignée, et une grande partie de ce que l'on salue dans la série 5 a commencé comme une amélioration de la 4.7. C'est aussi la génération qui a produit le palier GLM-4.7-Flash à 30B, qui reste la réponse de la famille aux équipes ayant besoin d'un modèle vraiment petit sans quitter la même licence MIT ni les mêmes hébergeurs de poids. Prises ensemble, les deux versions 4.7 marquent le moment où la famille a cessé d'être une lignée de recherche intéressante pour devenir quelque chose que l'on peut raisonnablement mettre derrière un produit.
Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.
La réponse s'affichera ici en streaming...
Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.
La plupart des évaluations de programmation vérifient si un correctif fait passer un test. Cela laisse de côté toute une catégorie de travail : produire du code d'interface qu'un humain acceptera sans le réécrire. Une mise en page qui tient, des espacements sensés, des composants qui suivent les conventions du framework utilisé — cela se juge visuellement et non par un exécuteur de tests, et un modèle qui se trompe crée du travail au lieu d'en économiser. Le progrès de GLM-4.7 sur ce terrain, associé à un dialogue plus naturel, l'a rendu utilisable comme binôme quotidien pour le développement applicatif, et plus seulement pour des tâches algorithmiques isolées. La même génération a aussi consolidé un raisonnement multi-étapes stable, ce qui a permis à la lignée GLM-5 de se concentrer sur la longueur d'horizon plutôt que sur la fiabilité d'exécution de base.
Le tableau comparatif publié couvre GLM-5.2 et GLM-5.1. La colonne ci-dessous est celle de GLM-5.1 — le point de référence publié le plus proche de la génération qui a suivi GLM-4.7. Aucune colonne de benchmarks n'a été publiée pour GLM-4.7 lui-même.
Aucune ligne GLM-4.7 n'existe dans le panel de comparaison publié, aucune n'est donc citée ici. La colonne de référence montre ce que la génération suivante a atteint en programmation : 58.4 sur SWE-bench Pro, 50.9 sur ProgramBench et 42.7 sur NL2Repo pour GLM-5.1, contre 62.1, 63.7 et 48.9 pour GLM-5.2. Si vous avez besoin de performances de programmation mesurées plutôt que d'un positionnement, ce sont les deux colonnes à lire.
Comparaison sur ProgramBench, telle que publiée par les auteurs du modèle.
ProgramBench est l'évaluation publiée la plus proche du point fort revendiqué de GLM-4.7. La frontière propriétaire mène — Claude Opus 4.8 à 71.9 et GPT-5.5 à 70.8 — devant GLM-5.2 à 63.7, GLM-5.1 à 50.9 et DeepSeek-V4-Pro à 47.8. Le champ des poids ouverts s'étale sur plus de quinze points sur cette ligne, ce qui rappelle utilement que « modèle ouvert » n'est pas un niveau de performance : la version précise que vous choisissez compte bien plus que la licence qu'elle porte.
GLM-4.7 succède à GLM-4.5-Air et précède GLM-5. Son propre frère léger, GLM-4.7-Flash, est un modèle de 30B issu de la même génération, et toute la lignée converge aujourd'hui vers GLM-5.2. Si vous choisissez un modèle GLM pour de la programmation aujourd'hui, le vaisseau amiral porte toutes les améliorations de la génération 4.7, plus la fenêtre de contexte 1M et une colonne de benchmarks publiée. La bonne façon de lire cette lignée : la capacité s'est accumulée tandis que la licence restait constante — tout ce qui se situe à partir du palier 4.5 est sous MIT avec des poids sur les mêmes hébergeurs publics, si bien que monter dans la famille est une décision de calcul et jamais une décision juridique.
Le vaisseau amiral à contexte d'1M de tokens. Il représente l'état de l'art open source sur les évaluations de programmation et de longue haleine, avec des niveaux d'effort explicites Non-Thinking, High et Max.
Le palier léger à 30B. Assez efficace et rapide pour l'inférence locale, et annoncé comme devançant les modèles ouverts d'échelle comparable.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.