GLM-5.2 vs GLM-5.1 : tous les gains d'une génération à l'autre

GLM-5.2 vs GLM-5.1 est la seule comparaison sans ambiguïté de ce site : sur les 19 évaluations publiées où les deux modèles ont un score, le plus récent remporte toutes les lignes. Ce qui rend la comparaison intéressante n'est pas qui gagne mais de combien, car les marges vont de quatre dixièmes de point à plus de quarante.

Cet étalement est la meilleure preuve disponible de ce que la génération a réellement changé. Le raisonnement standard a peu bougé, la programmation standard a modérément progressé, et l'exécution agentique de longue haleine a énormément progressé — exactement ce qu'on attend d'une version dont les changements phares sont un contexte multiplié par cinq et une pile d'attention sparse reconstruite. Tous les chiffres sont tels que publiés par les auteurs du modèle.

Le verdict

GLM-5.2 gagne 19 lignes sur 19GLM-5.1 gagne 0

GLM-5.2 remporte 19 lignes publiées sur 19 face à GLM-5.1. Les petites marges concernent des benchmarks déjà proches du plafond — HMMT nov. 2025 passe de 94.0 à 94.4 et HLE avec outils de 52.3 à 54.7. Les grandes concernent le travail de longue haleine : FrontierSWE Dominance de 30.5 à 74.4, SWE-Marathon de 1.0 à 13.0, DeepSWE de 18.0 à 46.2 et CritPt de 4.6 à 20.9. Terminal-Bench 2.1 passe de 63.5 à 81.0 sous Terminus-2 et de 69.0 à 82.7 sous Claude Code. Si vous utilisez GLM-5.1 aujourd'hui et que votre charge de travail est agentique, ce n'est pas une mise à niveau marginale.

GLM-5.2 vs GLM-5.1 : les spécifications en un coup d'œil

Les changements structurels expliquent l'étalement des benchmarks. Le plafond de contexte est passé de 200 000 à 1 000 000 de tokens, l'attention sparse a été reconstruite pour que chaque groupe de quatre couches partage un indexeur léger, le décalage de KV-cache entre entraînement et inférence de la couche de prédiction multi-tokens a été supprimé, et des niveaux d'effort explicites ont été introduits. Les deux versions restent des modèles GLM à poids ouverts sous licence MIT, chez les mêmes hébergeurs publics.

GLM-5.2 vs GLM-5.1 : les spécifications en un coup d'œil
CaractéristiqueGLM-5.2GLM-5.1
Fenêtre de contexte1 000 000 de tokens200 000 tokens
Architecture d'attentionAttention sparse avec IndexShareAttention sparse, un indexeur par couche
Longueur d'acceptation MTP5.47 (+20 %)4.56 (référence)
Contrôle de l'effortExplicite — Non-Thinking, High, MaxNon exposé
LicenceLicence MITLicence MIT

Benchmark par benchmark : GLM-5.2 vs GLM-5.1

Lisez d'abord le bloc programmation : neuf lignes, neuf victoires, et des progrès qui croissent avec la longueur des tâches. SWE-bench Pro gagne 3.7 points, ProgramBench 12.8, Terminal-Bench 2.1 17.5, DeepSWE 28.2 — une amélioration de 2.6× — et FrontierSWE Dominance 43.9. Le bloc raisonnement est un carton plein plus discret : HLE gagne 9.5, AIME 2026 3.9, IMOAnswerBench 7.2, GPQA-Diamond 5.0 et CritPt bondit de 4.6 à 20.9, soit plus de quatre fois son score précédent. L'ordre de ces écarts constitue à lui seul l'argument de cette version. Si la génération avait simplement été entraînée plus longtemps sur plus de données, on attendrait des gains à peu près uniformes sur tout le tableau ; au lieu de cela, les progrès suivent la durée des tâches de chaque évaluation, ce qu'on prédirait d'un contexte multiplié par cinq et d'une refonte de l'attention visant précisément le travail de longue haleine.

Benchmark par benchmark : GLM-5.2 vs GLM-5.1
BenchmarkGLM-5.2GLM-5.1Vainqueur
Programmation et horizon long
FrontierSWE Dominance74.430.5GLM-5.2
PostTrainBench34.320.1GLM-5.2
SWE-Marathon13.01.0GLM-5.2
SWE-bench Pro62.158.4GLM-5.2
NL2Repo48.942.7GLM-5.2
ProgramBench63.750.9GLM-5.2
DeepSWE46.218.0GLM-5.2
Terminal-Bench 2.1 (Terminus-2)81.063.5GLM-5.2
Terminal-Bench 2.1 (Claude Code)82.769.0GLM-5.2
Raisonnement et agentique
MCP-Atlas (public set)76.871.8GLM-5.2
Tool-Decathlon48.240.7GLM-5.2
HLE40.531.0GLM-5.2
HLE w/ Tools54.752.3GLM-5.2
CritPt20.94.6GLM-5.2
AIME 202699.295.3GLM-5.2
HMMT Nov. 202594.494.0GLM-5.2
HMMT Feb. 202692.582.6GLM-5.2
IMOAnswerBench91.083.8GLM-5.2
GPQA-Diamond91.286.2GLM-5.2

* score sur l'ensemble complet.

Tous les chiffres de cette page sont des résultats tels que publiés par les auteurs du modèle. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.

Voir en détail les 17 benchmarks GLM →

Quand choisir chaque modèle

Quand choisir GLM-5.2

Pour tout nouveau déploiement, GLM-5.2 est le choix par défaut. Il remporte toutes les lignes publiées, offre cinq fois le contexte, expose des niveaux d'effort pour dépenser le calcul à bon escient, et sert cette fenêtre plus large avec 2.9× moins de FLOPs par token grâce à IndexShare — le modèle plus grand n'est donc pas proportionnellement plus coûteux par token.

  • Vous démarrez un nouveau projet, où rien dans les données publiées ne justifie de choisir l'ancienne version.
  • Vos agents tournent pendant des heures — les lignes de longue haleine ont progressé de dizaines de points, pas de fractions.
  • Vous avez besoin de plus de 200 000 tokens de contexte et voulez que la fenêtre reste exploitable sur toute sa longueur.
  • Vous voulez un contrôle de l'effort par requête, que GLM-5.1 n'expose pas du tout.

Quand GLM-5.1 garde du sens

Il existe exactement un argument honnête pour rester sur GLM-5.1, et il est opérationnel plutôt que qualitatif. Une fenêtre de 200 000 tokens coûte bien moins de mémoire KV-cache à servir qu'une fenêtre d'un million : si vos tâches y tiennent vraiment et que votre matériel est juste, l'ancien modèle a une empreinte plus petite. Sur le travail de programmation borné, l'écart publié n'est que de quelques points.

  • Votre matériel de service est limité en mémoire et vos prompts tiennent confortablement dans 200 000 tokens.
  • Vous avez déjà un déploiement GLM-5.1 validé et aucune charge de longue haleine justifiant une nouvelle validation.
  • Vos tâches sont bornées, où l'écart publié sur SWE-bench Pro est de 62.1 contre 58.4 plutôt que quelque chose de spectaculaire.
  • Vous avez besoin d'un modèle figé et stable et préférez planifier la migration plutôt que l'engager maintenant.

Essayer le playground IA gratuit sur la page d'accueil →

FAQ GLM-5.2 vs GLM-5.1

Qu'est-ce qui a changé entre GLM-5.1 et GLM-5.2 ?
Quatre choses : le plafond de contexte est passé de 200 000 à 1 000 000 de tokens, l'attention sparse a été reconstruite autour d'IndexShare pour que chaque groupe de quatre couches partage un indexeur, le décalage de KV-cache de la couche de prédiction multi-tokens a été supprimé afin de porter la longueur d'acceptation de 4.56 à 5.47, et les niveaux d'effort explicites Non-Thinking, High et Max ont été introduits.
De combien la fenêtre de contexte de GLM-5.2 est-elle plus grande ?
Cinq fois plus grande — 1 000 000 de tokens contre 200 000 — avec jusqu'à 128 000 tokens de sortie. Les auteurs du modèle décrivent cette fenêtre élargie comme solide et non simplement acceptée : elle a été entraînée sur de longues trajectoires d'agents de code afin que la qualité tienne loin dans le contexte.
Qu'est-ce qu'IndexShare et pourquoi est-ce important ici ?
IndexShare permet à chaque groupe de quatre couches d'attention sparse de partager un indexeur léger, les indices top-k étant calculés une fois puis réutilisés. Cela supprime le travail d'indexation dans trois couches sur quatre et réduit les FLOPs par token de 2.9× à 1M de contexte, ce qui rend le service d'une fenêtre d'un million de tokens pratique plutôt que théorique.
Faut-il passer de GLM-5.1 à GLM-5.2 ?
Si votre charge de travail est agentique ou de longue haleine, oui — les gains publiés s'y comptent en dizaines de points, pas en unités. Si vos tâches sont bornées et que votre matériel de service est limité en mémoire, l'empreinte KV-cache plus petite de l'ancien modèle est une raison légitime d'attendre.
Les deux modèles GLM sont-ils toujours open source ?
Oui. GLM-5.1 et GLM-5.2 sont tous deux des versions à poids ouverts sous licence MIT, publiées sur HuggingFace et ModelScope sans restriction régionale. Une nouvelle version n'en retire pas une ancienne — les poids que vous détenez déjà restent utilisables indéfiniment.

Testez un modèle d'IA en direct, gratuitement et sans compte

Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.