Voici l'ensemble complet des benchmarks GLM publiés, réuni en un seul endroit : 17 évaluations sur 8 modèles, couvrant le raisonnement, la programmation et l'usage agentique d'outils, ainsi que les trois évaluations de longue haleine réalisées par des tiers. Tout ce qui figure sur cette page est un résultat tel que publié par les auteurs du modèle ou par l'organisation qui a mené l'évaluation. glmmodel.com rapporte ces chiffres ; il ne les produit pas.
Cette distinction n'est pas une clause de style. Les scores de benchmark dépendent du harnais dans une mesure qui surprend — le même modèle sur la même évaluation bouge de plusieurs points entre Terminus-2 et Claude Code — si bien que la section méthodologie en bas de page est sans doute plus utile que le tableau lui-même. Lisez ces chiffres comme une capacité annoncée dans des conditions données, pas comme une promesse sur votre charge de travail.
Tous les chiffres de cette page sont des résultats tels que publiés par les auteurs du modèle. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.
Dominance, tâches jusqu'à 20 heures
Meilleur modèle open sourceJusqu'à 10 heures sur un seul H100
2e au classement généralIngénierie logicielle ultra-longue, jusqu'à 10 heures
2e derrière la série OpusLe trio de longue haleine correspond à ce pour quoi la génération actuelle des modèles GLM a été construite, et les trois évaluations ont été menées par des organisations externes plutôt que par les auteurs du modèle. FrontierSWE mesure la dominance sur des tâches allant jusqu'à vingt heures ; PostTrainBench va jusqu'à dix heures sur un seul H100 ; SWE-Marathon est de l'ingénierie logicielle à très long horizon, également jusqu'à dix heures. GLM-5.2 est le modèle open source le mieux classé sur les trois. Il concède sept dixièmes de point à Claude Opus 4.8 sur FrontierSWE, y devance GPT-5.5 de 1.8, et dépasse Opus 4.7, de la génération précédente, de plus de onze points.
Comparer GLM-5.2 à GLM-5.1 isole ce qu'une génération de travail a produit, et comparer les deux au meilleur modèle fermé sur chaque ligne montre la distance qu'il reste à parcourir. Les pastilles d'écart ci-dessous correspondent au score publié de GLM-5.2 moins celui de GLM-5.1. Notez à quel point elles sont inégales : 3.7 points sur SWE-bench Pro contre 28.2 points sur DeepSWE. Les évaluations qui récompensent l'exécution soutenue ont bien plus progressé que celles qui récompensent un bon correctif isolé.
Le tableau complet ci-dessous fait foi ; il est regroupé en sections raisonnement, programmation et agentique. La colonne GLM-5.2 est mise en évidence. Un tiret signifie que les auteurs du modèle n'ont publié aucun score pour ce modèle sur ce benchmark, et ce site ne remplit pas ces cellules avec des estimations. Faites défiler horizontalement pour voir toutes les colonnes de modèles.
| Benchmark | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Raisonnement | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE w/ Tools | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programmation | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (best harness) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agentique | ||||||||
| MCP-Atlas (public set) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* score sur l'ensemble complet.
Résultats de benchmark publiés pour les modèles GLM, 17 évaluations sur 8 modèles.
Les réglages d'évaluation ci-dessous sont ceux publiés avec les résultats. Ils méritent d'être lus avant de citer un chiffre, car la longueur de contexte, les paramètres d'échantillonnage, la version du harnais et le budget de temps font tous bouger les scores de façon significative — et parce que plusieurs de ces évaluations ont été menées par des tiers plutôt que par les auteurs du modèle.
Échantillonnage à une température de 1.0 et top-p 0.95, avec une longueur de génération maximale de 163 840 tokens. Le sous-ensemble texte seul est rapporté par défaut ; les résultats marqués d'un astérisque proviennent de l'ensemble complet. AIME, HMMT et IMOAnswerBench utilisent un prompt système fixe de format de réponse, avec GPT-5.5 (medium) comme modèle juge. HLE avec outils utilise un contexte de 300 000 tokens et aucune stratégie de gestion du contexte.
Exécuté avec OpenHands en utilisant un prompt d'instruction sur mesure, à une température de 1, top-p 1 et un plafond de 32K nouveaux tokens, dans une fenêtre de contexte de 400K.
Évalué à une température de 1.0, top-p 1.0 et un plafond de 48K nouveaux tokens sous un contexte de 400K. Un jugement à base de règles et par LLM est appliqué pour bloquer les comportements malveillants tels que l'installation de paquets non autorisés ou les appels réseau.
Exécuté avec le framework d'évaluation officiel et le harnais mini-swe-agent à une température de 1.0, top-p 1.0 et un délai de deux heures sous un contexte de 400K. Chaque tâche s'exécute dans un conteneur isolé doté de 2 CPU, 8 Go de RAM et sans accès à Internet.
200 instances évaluées avec Claude Code 2.1.156 à une température de 1.0, top-p 1.0, un plafond de 64 000 tokens, jusqu'à 2 000 tours, un délai de six heures par échantillon et un effort de raisonnement maximal, sous un contexte de 400K. Chaque instance s'exécute dans un bac à sable à 4 CPU et 8 Go, sans accès à Internet.
Évalué avec le framework Terminus-2 en utilisant un parsing JSON, un délai de quatre heures, une température de 1.0, top-p 1.0, un plafond de 48K nouveaux tokens et jusqu'à 500 épisodes, sous une fenêtre de contexte de 256K. Les ressources sont plafonnées à 4 CPU et 8 Go de RAM.
Évalué dans Claude Code 2.1.167 à une température de 1.0, top-p 0.95 et 131 072 nouveaux tokens, le plafond de sortie de 64K du CLI étant contourné par un proxy transparent. Les limites de temps réel sont levées tandis que les contraintes de CPU et de mémoire par tâche sont conservées. Les scores sont moyennés sur cinq exécutions.
Tous les modèles évalués en mode réflexion sur le sous-ensemble public de 500 tâches, avec un délai de dix minutes par tâche et Gemini-3.0-Pro comme modèle juge.
Exécuté via le service d'évaluation officiel, avec un budget de tokens maximal fixé à 128K.
Menée par Proximal, et non par les auteurs du modèle, avec une longueur de contexte de 1M, le niveau d'effort maximal et 128K tokens de sortie maximum. Le score de dominance est rapporté au 16 juin 2026.
Menée par PostTrainBench, et non par les auteurs du modèle, avec une longueur de contexte de 1M, le niveau d'effort maximal et 128K tokens de sortie maximum.
Menée par Abundant AI, et non par les auteurs du modèle, avec une longueur de contexte de 1M, le niveau d'effort maximal et 128K tokens de sortie maximum.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.