GLM-5.2 vs GLM-5.1 est la seule comparaison sans ambiguïté de ce site : sur les 19 évaluations publiées où les deux modèles ont un score, le plus récent remporte toutes les lignes. Ce qui rend la comparaison intéressante n'est pas qui gagne mais de combien, car les marges vont de quatre dixièmes de point à plus de quarante.
Cet étalement est la meilleure preuve disponible de ce que la génération a réellement changé. Le raisonnement standard a peu bougé, la programmation standard a modérément progressé, et l'exécution agentique de longue haleine a énormément progressé — exactement ce qu'on attend d'une version dont les changements phares sont un contexte multiplié par cinq et une pile d'attention sparse reconstruite. Tous les chiffres sont tels que publiés par les auteurs du modèle.
GLM-5.2 remporte 19 lignes publiées sur 19 face à GLM-5.1. Les petites marges concernent des benchmarks déjà proches du plafond — HMMT nov. 2025 passe de 94.0 à 94.4 et HLE avec outils de 52.3 à 54.7. Les grandes concernent le travail de longue haleine : FrontierSWE Dominance de 30.5 à 74.4, SWE-Marathon de 1.0 à 13.0, DeepSWE de 18.0 à 46.2 et CritPt de 4.6 à 20.9. Terminal-Bench 2.1 passe de 63.5 à 81.0 sous Terminus-2 et de 69.0 à 82.7 sous Claude Code. Si vous utilisez GLM-5.1 aujourd'hui et que votre charge de travail est agentique, ce n'est pas une mise à niveau marginale.
Les changements structurels expliquent l'étalement des benchmarks. Le plafond de contexte est passé de 200 000 à 1 000 000 de tokens, l'attention sparse a été reconstruite pour que chaque groupe de quatre couches partage un indexeur léger, le décalage de KV-cache entre entraînement et inférence de la couche de prédiction multi-tokens a été supprimé, et des niveaux d'effort explicites ont été introduits. Les deux versions restent des modèles GLM à poids ouverts sous licence MIT, chez les mêmes hébergeurs publics.
| Caractéristique | GLM-5.2 | GLM-5.1 |
|---|---|---|
| Fenêtre de contexte | 1 000 000 de tokens | 200 000 tokens |
| Architecture d'attention | Attention sparse avec IndexShare | Attention sparse, un indexeur par couche |
| Longueur d'acceptation MTP | 5.47 (+20 %) | 4.56 (référence) |
| Contrôle de l'effort | Explicite — Non-Thinking, High, Max | Non exposé |
| Licence | Licence MIT | Licence MIT |
Lisez d'abord le bloc programmation : neuf lignes, neuf victoires, et des progrès qui croissent avec la longueur des tâches. SWE-bench Pro gagne 3.7 points, ProgramBench 12.8, Terminal-Bench 2.1 17.5, DeepSWE 28.2 — une amélioration de 2.6× — et FrontierSWE Dominance 43.9. Le bloc raisonnement est un carton plein plus discret : HLE gagne 9.5, AIME 2026 3.9, IMOAnswerBench 7.2, GPQA-Diamond 5.0 et CritPt bondit de 4.6 à 20.9, soit plus de quatre fois son score précédent. L'ordre de ces écarts constitue à lui seul l'argument de cette version. Si la génération avait simplement été entraînée plus longtemps sur plus de données, on attendrait des gains à peu près uniformes sur tout le tableau ; au lieu de cela, les progrès suivent la durée des tâches de chaque évaluation, ce qu'on prédirait d'un contexte multiplié par cinq et d'une refonte de l'attention visant précisément le travail de longue haleine.
| Benchmark | GLM-5.2 | GLM-5.1 | Vainqueur |
|---|---|---|---|
| Programmation et horizon long | |||
| FrontierSWE Dominance | 74.4 | 30.5 | GLM-5.2 |
| PostTrainBench | 34.3 | 20.1 | GLM-5.2 |
| SWE-Marathon | 13.0 | 1.0 | GLM-5.2 |
| SWE-bench Pro | 62.1 | 58.4 | GLM-5.2 |
| NL2Repo | 48.9 | 42.7 | GLM-5.2 |
| ProgramBench | 63.7 | 50.9 | GLM-5.2 |
| DeepSWE | 46.2 | 18.0 | GLM-5.2 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | GLM-5.2 |
| Terminal-Bench 2.1 (Claude Code) | 82.7 | 69.0 | GLM-5.2 |
| Raisonnement et agentique | |||
| MCP-Atlas (public set) | 76.8 | 71.8 | GLM-5.2 |
| Tool-Decathlon | 48.2 | 40.7 | GLM-5.2 |
| HLE | 40.5 | 31.0 | GLM-5.2 |
| HLE w/ Tools | 54.7 | 52.3 | GLM-5.2 |
| CritPt | 20.9 | 4.6 | GLM-5.2 |
| AIME 2026 | 99.2 | 95.3 | GLM-5.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | GLM-5.2 |
| HMMT Feb. 2026 | 92.5 | 82.6 | GLM-5.2 |
| IMOAnswerBench | 91.0 | 83.8 | GLM-5.2 |
| GPQA-Diamond | 91.2 | 86.2 | GLM-5.2 |
* score sur l'ensemble complet.
Tous les chiffres de cette page sont des résultats tels que publiés par les auteurs du modèle. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.
Voir en détail les 17 benchmarks GLM →Pour tout nouveau déploiement, GLM-5.2 est le choix par défaut. Il remporte toutes les lignes publiées, offre cinq fois le contexte, expose des niveaux d'effort pour dépenser le calcul à bon escient, et sert cette fenêtre plus large avec 2.9× moins de FLOPs par token grâce à IndexShare — le modèle plus grand n'est donc pas proportionnellement plus coûteux par token.
Il existe exactement un argument honnête pour rester sur GLM-5.1, et il est opérationnel plutôt que qualitatif. Une fenêtre de 200 000 tokens coûte bien moins de mémoire KV-cache à servir qu'une fenêtre d'un million : si vos tâches y tiennent vraiment et que votre matériel est juste, l'ancien modèle a une empreinte plus petite. Sur le travail de programmation borné, l'écart publié n'est que de quelques points.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.