Benchmarks GLM : les 17 résultats d'évaluation de GLM-5.2

Voici l'ensemble complet des benchmarks GLM publiés, réuni en un seul endroit : 17 évaluations sur 8 modèles, couvrant le raisonnement, la programmation et l'usage agentique d'outils, ainsi que les trois évaluations de longue haleine réalisées par des tiers. Tout ce qui figure sur cette page est un résultat tel que publié par les auteurs du modèle ou par l'organisation qui a mené l'évaluation. glmmodel.com rapporte ces chiffres ; il ne les produit pas.

Cette distinction n'est pas une clause de style. Les scores de benchmark dépendent du harnais dans une mesure qui surprend — le même modèle sur la même évaluation bouge de plusieurs points entre Terminus-2 et Claude Code — si bien que la section méthodologie en bas de page est sans doute plus utile que le tableau lui-même. Lisez ces chiffres comme une capacité annoncée dans des conditions données, pas comme une promesse sur votre charge de travail.

Les trois benchmarks GLM de longue haleine

Tous les chiffres de cette page sont des résultats tels que publiés par les auteurs du modèle. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.

74.4%
FrontierSWE

Dominance, tâches jusqu'à 20 heures

Meilleur modèle open source
34.3%
PostTrainBench

Jusqu'à 10 heures sur un seul H100

2e au classement général
13.0%
SWE-Marathon

Ingénierie logicielle ultra-longue, jusqu'à 10 heures

2e derrière la série Opus

Le trio de longue haleine correspond à ce pour quoi la génération actuelle des modèles GLM a été construite, et les trois évaluations ont été menées par des organisations externes plutôt que par les auteurs du modèle. FrontierSWE mesure la dominance sur des tâches allant jusqu'à vingt heures ; PostTrainBench va jusqu'à dix heures sur un seul H100 ; SWE-Marathon est de l'ingénierie logicielle à très long horizon, également jusqu'à dix heures. GLM-5.2 est le modèle open source le mieux classé sur les trois. Il concède sept dixièmes de point à Claude Opus 4.8 sur FrontierSWE, y devance GPT-5.5 de 1.8, et dépasse Opus 4.7, de la génération précédente, de plus de onze points.

Gains de benchmark GLM d'une génération à l'autre

Comparer GLM-5.2 à GLM-5.1 isole ce qu'une génération de travail a produit, et comparer les deux au meilleur modèle fermé sur chaque ligne montre la distance qu'il reste à parcourir. Les pastilles d'écart ci-dessous correspondent au score publié de GLM-5.2 moins celui de GLM-5.1. Notez à quel point elles sont inégales : 3.7 points sur SWE-bench Pro contre 28.2 points sur DeepSWE. Les évaluations qui récompensent l'exécution soutenue ont bien plus progressé que celles qui récompensent un bon correctif isolé.

Terminal-Bench 2.1+17.5
SWE-bench Pro+3.7
NL2Repo+6.2
DeepSWE+28.2 (2.6×)
ProgramBench+12.8
MCP-Atlas+5.0
Tool-Decathlon+7.5
HLE+9.5

Les 17 benchmarks GLM sur 8 modèles

Le tableau complet ci-dessous fait foi ; il est regroupé en sections raisonnement, programmation et agentique. La colonne GLM-5.2 est mise en évidence. Un tiret signifie que les auteurs du modèle n'ont publié aucun score pour ce modèle sur ce benchmark, et ce site ne remplit pas ces cellules avec des estimations. Faites défiler horizontalement pour voir toutes les colonnes de modèles.

Résultats de benchmark publiés pour les modèles GLM, toutes évaluations et tous modèles confondus
BenchmarkGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Raisonnement
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programmation
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agentique
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* score sur l'ensemble complet.

Résultats de benchmark publiés pour les modèles GLM, 17 évaluations sur 8 modèles.

Comment ces benchmarks GLM ont été évalués

Les réglages d'évaluation ci-dessous sont ceux publiés avec les résultats. Ils méritent d'être lus avant de citer un chiffre, car la longueur de contexte, les paramètres d'échantillonnage, la version du harnais et le budget de temps font tous bouger les scores de façon significative — et parce que plusieurs de ces évaluations ont été menées par des tiers plutôt que par les auteurs du modèle.

HLE et autres tâches de raisonnement

Échantillonnage à une température de 1.0 et top-p 0.95, avec une longueur de génération maximale de 163 840 tokens. Le sous-ensemble texte seul est rapporté par défaut ; les résultats marqués d'un astérisque proviennent de l'ensemble complet. AIME, HMMT et IMOAnswerBench utilisent un prompt système fixe de format de réponse, avec GPT-5.5 (medium) comme modèle juge. HLE avec outils utilise un contexte de 300 000 tokens et aucune stratégie de gestion du contexte.

SWE-bench Pro

Exécuté avec OpenHands en utilisant un prompt d'instruction sur mesure, à une température de 1, top-p 1 et un plafond de 32K nouveaux tokens, dans une fenêtre de contexte de 400K.

NL2Repo

Évalué à une température de 1.0, top-p 1.0 et un plafond de 48K nouveaux tokens sous un contexte de 400K. Un jugement à base de règles et par LLM est appliqué pour bloquer les comportements malveillants tels que l'installation de paquets non autorisés ou les appels réseau.

DeepSWE

Exécuté avec le framework d'évaluation officiel et le harnais mini-swe-agent à une température de 1.0, top-p 1.0 et un délai de deux heures sous un contexte de 400K. Chaque tâche s'exécute dans un conteneur isolé doté de 2 CPU, 8 Go de RAM et sans accès à Internet.

ProgramBench

200 instances évaluées avec Claude Code 2.1.156 à une température de 1.0, top-p 1.0, un plafond de 64 000 tokens, jusqu'à 2 000 tours, un délai de six heures par échantillon et un effort de raisonnement maximal, sous un contexte de 400K. Chaque instance s'exécute dans un bac à sable à 4 CPU et 8 Go, sans accès à Internet.

Terminal-Bench 2.1 (Terminus-2)

Évalué avec le framework Terminus-2 en utilisant un parsing JSON, un délai de quatre heures, une température de 1.0, top-p 1.0, un plafond de 48K nouveaux tokens et jusqu'à 500 épisodes, sous une fenêtre de contexte de 256K. Les ressources sont plafonnées à 4 CPU et 8 Go de RAM.

Terminal-Bench 2.1 (Claude Code)

Évalué dans Claude Code 2.1.167 à une température de 1.0, top-p 0.95 et 131 072 nouveaux tokens, le plafond de sortie de 64K du CLI étant contourné par un proxy transparent. Les limites de temps réel sont levées tandis que les contraintes de CPU et de mémoire par tâche sont conservées. Les scores sont moyennés sur cinq exécutions.

MCP-Atlas

Tous les modèles évalués en mode réflexion sur le sous-ensemble public de 500 tâches, avec un délai de dix minutes par tâche et Gemini-3.0-Pro comme modèle juge.

Tool-Decathlon

Exécuté via le service d'évaluation officiel, avec un budget de tokens maximal fixé à 128K.

FrontierSWE

Menée par Proximal, et non par les auteurs du modèle, avec une longueur de contexte de 1M, le niveau d'effort maximal et 128K tokens de sortie maximum. Le score de dominance est rapporté au 16 juin 2026.

PostTrainBench

Menée par PostTrainBench, et non par les auteurs du modèle, avec une longueur de contexte de 1M, le niveau d'effort maximal et 128K tokens de sortie maximum.

SWE-Marathon

Menée par Abundant AI, et non par les auteurs du modèle, avec une longueur de contexte de 1M, le niveau d'effort maximal et 128K tokens de sortie maximum.

FAQ benchmarks GLM

Quels sont les scores de benchmark de GLM-5.2 ?
Les chiffres publiés les plus marquants sont 81.0 sur Terminal-Bench 2.1, 62.1 sur SWE-bench Pro, 74.4 sur FrontierSWE Dominance, 34.3 sur PostTrainBench, 46.2 sur DeepSWE, 76.8 sur l'ensemble public MCP-Atlas et 99.2 sur AIME 2026. C'est le modèle open source le mieux classé sur les trois évaluations de longue haleine.
Qui a réalisé ces benchmarks GLM ?
Les auteurs du modèle en ont mené la plupart et publié les réglages. Les trois évaluations de longue haleine ont été menées par des tiers : FrontierSWE par Proximal, PostTrainBench par PostTrainBench et SWE-Marathon par Abundant AI. glmmodel.com n'en a réalisé aucune et les rapporte toutes telles que publiées.
Pourquoi Terminal-Bench 2.1 a-t-il deux scores différents ?
Parce que le harnais change le résultat. Sous Terminus-2, GLM-5.2 obtient 81.0 et Claude Opus 4.8 85.0 ; sous Claude Code, GLM-5.2 obtient 82.7 et Opus 4.8 78.9. Même benchmark, vainqueur inverse — c'est pourquoi le harnais devrait toujours être cité à côté du chiffre.
Pourquoi certaines cellules du tableau sont-elles vides ?
Un tiret signifie qu'aucun score n'a été publié pour ce modèle sur ce benchmark. Ce site n'estime pas, n'interpole pas et ne déduit pas les cellules manquantes, car un chiffre fabriqué dans un tableau comparatif est pire qu'un blanc assumé.
Puis-je reproduire ces résultats de benchmark GLM ?
Potentiellement, si vous reprenez les réglages publiés — longueur de contexte, paramètres d'échantillonnage, version du harnais, délais et limites de ressources sont tous listés dans la section méthodologie ci-dessus. Attendez-vous à de la variance dans tous les cas ; plusieurs de ces évaluations moyennent plusieurs exécutions précisément parce qu'une exécution unique est bruitée.

Testez un modèle d'IA en direct, gratuitement et sans compte

Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.