GLM Model — l'IA ouverte à contexte 1M conçue pour les tâches longues

GLM-5.2 est le modèle d'IA GLM phare à poids ouverts : un contexte solide d'1M de tokens, des niveaux d'effort Non-Thinking / High / Max et des scores annoncés de 81.0 sur Terminal-Bench 2.1 et 74.4 sur FrontierSWE. Comparez tous les modèles GLM ci-dessous — ou commencez par le playground IA gratuit.

1M
tokens de contexte
passé de 200K, et stable sous charge agentique
81.0
Terminal-Bench 2.1
annoncé pour GLM-5.2, contre 63.5 pour GLM-5.1
MIT
licence open source
poids ouverts, sans restriction régionale

Playground IA gratuit — testez un LLM open source en direct

Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.

La réponse s'affichera ici en streaming...

Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.

Les points forts de la famille de modèles GLM

Quatre capacités définissent la génération actuelle des modèles GLM — toutes annoncées par les auteurs du modèle et reproductibles à partir des poids ouverts.

Un contexte 1M solide

Un contexte d'1M de tokens qui reste réellement exploitable, et pas seulement accepté : GLM-5.2 a été entraîné sur des trajectoires d'agents de code à long contexte couvrant l'implémentation à grande échelle, la recherche automatisée et le débogage complexe.

Des niveaux d'effort flexibles

Non-Thinking, High et Max permettent d'arbitrer entre latence et capacité selon la tâche — environ 63 % à ~35K tokens de sortie, jusqu'à 74 % à ~83K sur les évaluations de code agentique.

Architecture IndexShare

Un indexeur léger unique partagé par groupes de quatre couches d'attention sparse réduit les FLOPs par token de 2.9× à 1M de contexte, sans perte de qualité à longue portée.

Poids ouverts sous MIT

Un modèle GLM open source sous licence MIT : poids sur HuggingFace et ModelScope, aucune restriction régionale, et service local via transformers, vLLM, SGLang, xLLM et ktransformers.

Benchmarks GLM 5.2 : les résultats sur tâches longues

Tous les chiffres ci-dessous sont des résultats publiés par les auteurs du modèle pour GLM-5.2 et son panel de comparaison. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.

Meilleur modèle open source
74.4%

FrontierSWE

Dominance, tâches jusqu'à 20 heures

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
2e au classement général
34.3%

PostTrainBench

Jusqu'à 10 heures sur un seul H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
2e derrière la série Opus
13.0%

SWE-Marathon

Ingénierie logicielle ultra-longue, jusqu'à 10 heures

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

Sur les trois benchmarks de tâches longues, GLM-5.2 est le modèle open source le mieux classé — la preuve que son contexte 1M se traduit en travail livré, et pas seulement en tokens acceptés. Il concède un point à Opus 4.8 sur FrontierSWE, devance GPT-5.5 d'un point et dépasse Opus 4.7, la génération précédente, de onze points.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Scores des modèles GLM sur 17 benchmarks

Résultats de benchmark publiés pour les modèles GLM, 17 évaluations sur 8 modèles.

Résultats de benchmark publiés pour les modèles GLM, toutes évaluations et tous modèles confondus
BenchmarkGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Raisonnement
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programmation
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agentique
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* score sur l'ensemble complet.

Niveaux d'effort : Non-Thinking, High et Max

Un modèle GLM n'a pas une seule vitesse. Le contrôle du niveau d'effort permet de dépenser davantage de calcul uniquement sur les tâches qui le méritent.

Non-Thinking

~63%

~35K tokens en moyenne

Modifications rapides, code répétitif, refactorisations de routine où la latence prime sur la profondeur.

Le plus utilisé

High

~72%

~43K tokens en moyenne

Le réglage par défaut pour la plupart des tâches de code agentique : une qualité proche de Max pour environ la moitié des tokens.

Max

~74%

~83K tokens en moyenne

Problèmes difficiles et de longue haleine — allouez du calcul supplémentaire quand la tâche le justifie vraiment.

Moyenne sur Terminal-Bench 2.1, DeepSWE et SWE-Atlas QnA, évalués sur Claude Code 2.1.167. Chiffres annoncés par les auteurs du modèle. À budget de tokens comparable, GLM-5.2 se situe entre Claude Opus 4.7 et Opus 4.8.

Comment le modèle GLM atteint 1M de contexte

Faire passer un plafond de contexte de 200K à 1M de tokens est un problème d'ingénierie, pas une option de configuration. Trois changements font le travail.

IndexShare pour l'attention sparse

Chaque groupe de quatre couches transformer partage un indexeur léger. Il se trouve sur la première des quatre, et ses indices top-k sont réutilisés par les trois autres — ce qui supprime le produit scalaire de l'indexeur et la sélection top-k dans 3 couches sur 4. Résultat : 2.9× moins de FLOPs par token à 1M de contexte. Entraîné avec IndexShare dès le mid-training, à une longueur de séquence de 128K.

Partage de couches du modèle GLM avec IndexShareCouche N+3Couche N+2Couche N+1Couche NIndexeurpartagé

MTP avec IndexShare et KVShare

La couche de prédiction multi-tokens exécute son indexeur une seule fois lors du premier brouillon et réutilise les indices pour les étapes suivantes, éliminant le décalage de KV-cache entre entraînement et inférence qui bridait la génération précédente. Combiné à un échantillonnage par rejet et à une perte TV de bout en bout, la longueur d'acceptation passe de 4.56 à 5.47 — environ 20 % — sur 7 étapes MTP.

Ablation de la longueur d'acceptation MTP
Référence4.56
+ IndexShare + KVShare5.10
+ Échantillonnage par rejet5.29
+ Perte TV de bout en bout5.47 (+20%)

Servir 1M de contexte efficacement

Au-delà de quelques centaines de milliers de tokens, le goulot d'étranglement n'est plus le calcul mais la capacité du KV-cache, les kernels long contexte et la surcharge CPU. Trois correctifs : une gestion mémoire et un parallélisme fins fondés sur LayerSplit, un travail de kernels adapté à l'échelle du contexte et coordonné avec le pipeline de transfert de cache, et une gestion du cache côté CPU accompagnée d'un ordonnancement des requêtes et d'un réglage des chemins d'exécution. L'avantage en débit s'accroît à mesure que le contexte s'allonge.

Avantage de débit normalisé

Entraîné par RL agentique

La pile d'entraînement (slime) combine rollout en boîte blanche et en boîte noire, trajectoires compactes et workflows de sous-agents. L'entraînement OPD parallèle a fusionné plus de dix modèles experts en environ deux jours, un KV-cache FP8 maintenant la mémoire de rollout dans les clous.

Anti-reward-hacking

Le RL sur horizon long invite aux raccourcis : les actions suspectes passent donc un filtre de rappel à base de règles, puis un contrôle de précision par LLM-juge. Les détournements confirmés sont bloqués en ligne et reçoivent un résultat d'outil factice, ce qui laisse le rollout se poursuivre au lieu d'être jeté. Un PPO à critique appliqué aux rollouts individuels garde les sous-traces de compaction entraînables.

Là où un modèle GLM à horizon long fait la différence

Implémentation à grande échelle

Des fonctionnalités multi-fichiers qui survivent à une seule fenêtre de contexte : le modèle garde l'état complet du dépôt sous les yeux au lieu de le relire toutes les trois tours.

Recherche automatisée

Des boucles d'expérimentation de plusieurs heures où un agent doit planifier, exécuter, lire les résultats et corriger — exactement la charge de travail que FrontierSWE et PostTrainBench ont été conçus pour mesurer.

Optimisation des performances

Un travail sur les kernels et les systèmes qui exige de garder ensemble le graphe d'appels complet, les sorties de profileur et les tentatives précédentes dans une même trajectoire.

Débogage complexe

Longues traces de reproduction, tests instables et pannes inter-services, où tronquer le contexte revient à perdre le bug.

Faites tourner tout cela sur votre propre matériel — poids MIT, transformers · vLLM · SGLang · xLLM · ktransformers. Comment exécuter un modèle GLM en local →

FAQ modèle GLM

GLM est une famille de grands modèles de langage à poids ouverts dont le vaisseau amiral actuel est GLM-5.2. La lignée va de GLM-4.5-Air et GLM-4.7 à GLM-5, GLM-5-Turbo, GLM-5.1 et désormais GLM-5.2, auxquels s'ajoutent des variantes vocales et visuelles. Chaque modèle GLM principal est publié sous licence MIT, avec des poids diffusés ouvertement.

Testez un modèle d'IA en direct, gratuitement et sans compte

Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.