GLM-5.2 — le modèle GLM phare à contexte 1M

GLM-5.2 est le modèle GLM phare à poids ouverts, conçu pour mener à terme des tâches de longue haleine et pour le code agentique plutôt que pour la conversation en un tour. C'est la version qui a fait passer le contexte utilisable de la famille de 200 000 à un solide million de tokens, introduit des niveaux d'effort explicites et reconstruit la pile d'attention sparse autour d'un indexeur partagé. Pour une équipe qui évalue des alternatives à poids ouverts face à la frontière propriétaire, c'est le modèle GLM qui rivalise réellement sur les évaluations qui comptent pour elle — et il le fait sous licence MIT, avec des poids publiés ouvertement.

Comparé à son prédécesseur GLM-5.1, GLM-5.2 n'est pas une simple mise à jour incrémentale. Terminal-Bench 2.1 passe de 63.5 à 81.0, DeepSWE de 18.0 à 46.2 et FrontierSWE Dominance de 30.5 à 74.4 — tous ces chiffres étant publiés par les auteurs du modèle et aucun mesuré ici. La conséquence pratique : un agent de code peut garder un dépôt entier, ses sorties de tests et ses propres tentatives précédentes dans une même trajectoire, au lieu d'en relire des fragments via une couche de récupération.

1M
tokens de contexte
passé de 200K et entraîné pour rester exploitable sur toute la fenêtre
81.0
Terminal-Bench 2.1
publié pour GLM-5.2, contre 63.5 pour GLM-5.1
MIT
licence open source
poids ouverts, sans restriction régionale

Playground IA gratuit — testez un LLM open source en direct

Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.

La réponse s'affichera ici en streaming...

Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.

Ce que la fenêtre de contexte 1M vous apporte vraiment

Un contexte d'un million de tokens change ce que vous construisez, pas seulement la quantité de texte que vous pouvez coller. Au lieu d'un pipeline de récupération qui alimente le modèle avec de petits extraits lacunaires, vous pouvez charger un dépôt entier, une référence d'API complète ou plusieurs jours de logs dans un seul prompt et laisser le modèle raisonner sur l'ensemble d'un coup. C'est ce qui rend visibles les dépendances inter-fichiers et les défaillances systémiques : le bug qui n'apparaît que lorsque la frontière de service, la migration et la fixture de test sont toutes sous les yeux en même temps. GLM-5.2 a été entraîné sur des trajectoires d'agents de code à long contexte couvrant l'implémentation à grande échelle, la recherche automatisée, l'optimisation des performances et le débogage complexe : c'est pourquoi les auteurs du modèle décrivent la fenêtre comme solide et non simplement acceptée — la qualité est censée tenir loin dans le contexte au lieu de se dégrader dès qu'une exécution devient confuse.

Fenêtre de contexte
1 000 000 de tokens
Licence
Open source MIT
Niveaux d'effort
Non-Thinking · High · Max
Sortie maximale
128 000 tokens
Hébergement des poids
HuggingFace · ModelScope

Résultats de benchmark de GLM-5.2

Scores tels que publiés par les auteurs du modèle.

La colonne publiée de GLM-5.2 est la plus forte exactement là où le modèle a été conçu pour l'être : le code agentique et l'exécution de longue haleine. Il affiche 81.0 sur Terminal-Bench 2.1 sous le harnais Terminus-2 et 82.7 sous Claude Code, 76.8 sur l'ensemble public MCP-Atlas, et 74.4 sur FrontierSWE Dominance, où les tâches individuelles durent jusqu'à vingt heures. En raisonnement pur, il rapporte 99.2 sur AIME 2026 et 91.2 sur GPQA-Diamond. Sur les trois évaluations de longue haleine — FrontierSWE, PostTrainBench et SWE-Marathon — il est le modèle open source le mieux classé du panel de comparaison publié.

Voir en détail les 17 benchmarks GLM →

Comment GLM-5.2 se compare

Comparaison sur SWE-bench Pro, telle que publiée par les auteurs du modèle.

Sur SWE-bench Pro, le 62.1 de GLM-5.2 reste derrière les 69.2 de Claude Opus 4.8 mais dépasse GPT-5.5 à 58.6 et Gemini 3.1 Pro à 54.2 — et il devance son propre prédécesseur GLM-5.1 à 58.4. Ce schéma se répète dans tout le tableau : la frontière propriétaire mène encore plusieurs évaluations de programmation standard, tandis que GLM-5.2 domine le champ des poids ouverts et remporte certaines lignes de haute lutte, dont Terminal-Bench 2.1 sous le harnais Claude Code (82.7 contre 78.9) et AIME 2026 (99.2 contre 95.7).

Lire la comparaison complète GLM vs Claude →

La place de GLM-5.2 dans la gamme des modèles GLM

GLM-5.2 est aujourd'hui à la tête d'une lignée qui va de GLM-4.5-Air et GLM-4.7 à GLM-5, GLM-5-Turbo et GLM-5.1. Chaque étape a porté une priorité différente — GLM-4.7 sur la programmation et la génération front-end, GLM-5-Turbo sur l'exécution d'agents à longue chaîne, GLM-5.1 sur le travail autonome de plusieurs heures — et GLM-5.2 réunit ces acquis dans un seul modèle doté d'une fenêtre bien plus grande. Si votre budget matériel exclut le vaisseau amiral, les paliers légers GLM-4.7-Flash et GLM-4.5-Air appartiennent à la même famille sous la même licence MIT.

Autres modèles GLM

Tout voir

FAQ GLM-5.2

Qu'est-ce qui distingue GLM-5.2 de GLM-5.1 ?
GLM-5.2 fait passer le contexte utilisable de 200 000 à un solide 1 000 000 de tokens et reconstruit l'attention sparse autour d'IndexShare, ce qui réduit les FLOPs par token de 2.9× à 1M de contexte. Les écarts de benchmark publiés sont importants : Terminal-Bench 2.1 passe de 63.5 à 81.0, DeepSWE de 18.0 à 46.2 et FrontierSWE Dominance de 30.5 à 74.4. Il introduit également les niveaux d'effort Non-Thinking, High et Max.
GLM-5.2 est-il open source ?
Oui. Les poids principaux de GLM-5.2 sont publiés sous licence MIT, sans restriction régionale, sur HuggingFace et ModelScope. Vous pouvez les télécharger, les affiner et les servir sur votre propre matériel sans demander d'autorisation, et sans que vos prompts quittent votre infrastructure.
Puis-je exécuter le modèle GLM-5.2 en local ?
Oui. Les auteurs du modèle annoncent la prise en charge de transformers, vLLM, SGLang, xLLM et ktransformers. Servir le contexte 1M complet est davantage un problème de mémoire que de calcul — au-delà de quelques centaines de milliers de tokens, le goulot d'étranglement devient la capacité du KV-cache — c'est pourquoi la plupart des déploiements auto-hébergés utilisent une fenêtre plus courte avec les mêmes poids.
Quels sont les niveaux d'effort de GLM-5.2 ?
Non-Thinking, High et Max contrôlent la quantité de calcul que le modèle consacre à chaque tâche. Sur la courbe publiée pour le code agentique, cela donne environ 63 % à près de 35K tokens de sortie, 72 % à environ 43K et 74 % à environ 83K. High est le réglage par défaut en pratique ; Max ne justifie sa dépense en tokens que sur des problèmes réellement difficiles et de longue haleine.
Comment GLM-5.2 se compare-t-il à Claude Opus 4.8 ?
Opus 4.8 mène la plupart du tableau publié, dont SWE-bench Pro à 69.2 contre 62.1, NL2Repo et SWE-Marathon. GLM-5.2 remporte Terminal-Bench 2.1 sous le harnais Claude Code à 82.7 contre 78.9, ainsi qu'AIME 2026 et IMOAnswerBench, et se situe à moins d'un point sur FrontierSWE. Il offre en outre une fenêtre de contexte cinq fois plus grande et des poids ouverts.

Testez un modèle d'IA en direct, gratuitement et sans compte

Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.