GLM-5.2 est le modèle d'IA GLM phare à poids ouverts : un contexte solide d'1M de tokens, des niveaux d'effort Non-Thinking / High / Max et des scores annoncés de 81.0 sur Terminal-Bench 2.1 et 74.4 sur FrontierSWE. Comparez tous les modèles GLM ci-dessous — ou commencez par le playground IA gratuit.
Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.
La réponse s'affichera ici en streaming...
Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.
Quatre capacités définissent la génération actuelle des modèles GLM — toutes annoncées par les auteurs du modèle et reproductibles à partir des poids ouverts.
Un contexte d'1M de tokens qui reste réellement exploitable, et pas seulement accepté : GLM-5.2 a été entraîné sur des trajectoires d'agents de code à long contexte couvrant l'implémentation à grande échelle, la recherche automatisée et le débogage complexe.
Non-Thinking, High et Max permettent d'arbitrer entre latence et capacité selon la tâche — environ 63 % à ~35K tokens de sortie, jusqu'à 74 % à ~83K sur les évaluations de code agentique.
Un indexeur léger unique partagé par groupes de quatre couches d'attention sparse réduit les FLOPs par token de 2.9× à 1M de contexte, sans perte de qualité à longue portée.
Un modèle GLM open source sous licence MIT : poids sur HuggingFace et ModelScope, aucune restriction régionale, et service local via transformers, vLLM, SGLang, xLLM et ktransformers.
Tous les chiffres ci-dessous sont des résultats publiés par les auteurs du modèle pour GLM-5.2 et son panel de comparaison. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.
Dominance, tâches jusqu'à 20 heures
Jusqu'à 10 heures sur un seul H100
Ingénierie logicielle ultra-longue, jusqu'à 10 heures
Sur les trois benchmarks de tâches longues, GLM-5.2 est le modèle open source le mieux classé — la preuve que son contexte 1M se traduit en travail livré, et pas seulement en tokens acceptés. Il concède un point à Opus 4.8 sur FrontierSWE, devance GPT-5.5 d'un point et dépasse Opus 4.7, la génération précédente, de onze points.
Résultats de benchmark publiés pour les modèles GLM, 17 évaluations sur 8 modèles.
| Benchmark | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Raisonnement | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE w/ Tools | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programmation | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (best harness) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agentique | ||||||||
| MCP-Atlas (public set) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* score sur l'ensemble complet.
Un modèle GLM n'a pas une seule vitesse. Le contrôle du niveau d'effort permet de dépenser davantage de calcul uniquement sur les tâches qui le méritent.
~35K tokens en moyenne
Modifications rapides, code répétitif, refactorisations de routine où la latence prime sur la profondeur.
~43K tokens en moyenne
Le réglage par défaut pour la plupart des tâches de code agentique : une qualité proche de Max pour environ la moitié des tokens.
~83K tokens en moyenne
Problèmes difficiles et de longue haleine — allouez du calcul supplémentaire quand la tâche le justifie vraiment.
Moyenne sur Terminal-Bench 2.1, DeepSWE et SWE-Atlas QnA, évalués sur Claude Code 2.1.167. Chiffres annoncés par les auteurs du modèle. À budget de tokens comparable, GLM-5.2 se situe entre Claude Opus 4.7 et Opus 4.8.
Faire passer un plafond de contexte de 200K à 1M de tokens est un problème d'ingénierie, pas une option de configuration. Trois changements font le travail.
Chaque groupe de quatre couches transformer partage un indexeur léger. Il se trouve sur la première des quatre, et ses indices top-k sont réutilisés par les trois autres — ce qui supprime le produit scalaire de l'indexeur et la sélection top-k dans 3 couches sur 4. Résultat : 2.9× moins de FLOPs par token à 1M de contexte. Entraîné avec IndexShare dès le mid-training, à une longueur de séquence de 128K.
La couche de prédiction multi-tokens exécute son indexeur une seule fois lors du premier brouillon et réutilise les indices pour les étapes suivantes, éliminant le décalage de KV-cache entre entraînement et inférence qui bridait la génération précédente. Combiné à un échantillonnage par rejet et à une perte TV de bout en bout, la longueur d'acceptation passe de 4.56 à 5.47 — environ 20 % — sur 7 étapes MTP.
| Référence | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Échantillonnage par rejet | 5.29 |
| + Perte TV de bout en bout | 5.47 (+20%) |
Au-delà de quelques centaines de milliers de tokens, le goulot d'étranglement n'est plus le calcul mais la capacité du KV-cache, les kernels long contexte et la surcharge CPU. Trois correctifs : une gestion mémoire et un parallélisme fins fondés sur LayerSplit, un travail de kernels adapté à l'échelle du contexte et coordonné avec le pipeline de transfert de cache, et une gestion du cache côté CPU accompagnée d'un ordonnancement des requêtes et d'un réglage des chemins d'exécution. L'avantage en débit s'accroît à mesure que le contexte s'allonge.
Avantage de débit normalisé
La pile d'entraînement (slime) combine rollout en boîte blanche et en boîte noire, trajectoires compactes et workflows de sous-agents. L'entraînement OPD parallèle a fusionné plus de dix modèles experts en environ deux jours, un KV-cache FP8 maintenant la mémoire de rollout dans les clous.
Le RL sur horizon long invite aux raccourcis : les actions suspectes passent donc un filtre de rappel à base de règles, puis un contrôle de précision par LLM-juge. Les détournements confirmés sont bloqués en ligne et reçoivent un résultat d'outil factice, ce qui laisse le rollout se poursuivre au lieu d'être jeté. Un PPO à critique appliqué aux rollouts individuels garde les sous-traces de compaction entraînables.
Du palier Flash à 30B au vaisseau amiral à contexte 1M — choisissez un modèle GLM et consultez sa fiche technique complète et sa colonne de benchmarks.
Contexte d'1M de tokens, état de l'art open source en programmation et sur les tâches longues, ingénierie agentique renforcée.
Le précédent vaisseau amiral : de forts gains sur les tâches longues et plusieurs heures de travail autonome à un niveau de qualité professionnel.
Programmation renforcée, exécution multi-étapes plus fiable et meilleur comportement d'agent sur les tâches complexes.
Modèle de base optimisé pour les scénarios d'agents dynamiques à longue chaîne.
Programmation améliorée, raisonnement multi-étapes stable et meilleure génération front-end.
30B de paramètres ; efficace et performant, devant les modèles ouverts d'échelle comparable.
Modèle GLM à faible empreinte, avec de solides performances par unité de calcul.
Reconnaissance vocale en temps réel avec un CER de 0.0717.
Des fonctionnalités multi-fichiers qui survivent à une seule fenêtre de contexte : le modèle garde l'état complet du dépôt sous les yeux au lieu de le relire toutes les trois tours.
Des boucles d'expérimentation de plusieurs heures où un agent doit planifier, exécuter, lire les résultats et corriger — exactement la charge de travail que FrontierSWE et PostTrainBench ont été conçus pour mesurer.
Un travail sur les kernels et les systèmes qui exige de garder ensemble le graphe d'appels complet, les sorties de profileur et les tentatives précédentes dans une même trajectoire.
Longues traces de reproduction, tests instables et pannes inter-services, où tronquer le contexte revient à perdre le bug.
Faites tourner tout cela sur votre propre matériel — poids MIT, transformers · vLLM · SGLang · xLLM · ktransformers. Comment exécuter un modèle GLM en local →
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.