GLM vs Qwen3.7-Max oppose deux des versions à poids ouverts les plus solides, et le résultat est plus serré que dans la comparaison avec DeepSeek. Sur les 13 évaluations publiées où les deux ont un score, GLM-5.2 en prend 10 et Qwen3.7-Max trois — mais les trois de Qwen relèvent toutes des mathématiques et du raisonnement à forte teneur en connaissances, ce qui rend la répartition facile à interpréter.
Chaque chiffre ici est un résultat tel que publié par les auteurs de chaque modèle, reproduit sans ajustement. Ce site n'exécute pas les évaluations et n'extrapole pas un score dans une ligne où les auteurs n'en ont publié aucun — plusieurs benchmarks sont simplement absents de cette comparaison pour cette raison.
GLM-5.2 remporte 10 des 13 lignes, dont toutes celles de programmation : SWE-bench Pro 62.1 contre 60.6, NL2Repo 48.9 contre 47.2, Terminal-Bench 2.1 81.0 contre 75.0 et DeepSWE 46.2 contre 18.0, le plus grand écart de la page. Qwen3.7-Max gagne HLE 41.4 contre 40.5, HMMT nov. 2025 95.0 contre 94.4 et HMMT fév. 2026 97.1 contre 92.5. Deux de ces trois marges sont inférieures à un point. La lecture honnête : ces modèles sont quasiment à parité sur les connaissances et les mathématiques, et GLM-5.2 prend le large à mesure que les tâches deviennent plus longues et plus agentiques.
Les deux modèles appartiennent au monde des poids ouverts : les différences structurelles qui comptent sont donc le contexte et le contrôle, plutôt que la philosophie de licence. GLM-5.2 publie une fenêtre de 1 000 000 de tokens et trois niveaux d'effort explicites ; ni l'un ni l'autre ne fait partie du panel de comparaison publié pour Qwen3.7-Max, et ce tableau le signale au lieu de remplir la cellule par une supposition.
| Caractéristique | GLM-5.2 | Qwen3.7-Max |
|---|---|---|
| Fenêtre de contexte | 1 000 000 de tokens | Non publié |
| Ouverture | Poids ouverts | Famille à poids ouverts |
| Licence | Licence MIT | Voir les conditions de publication de l'éditeur |
| Contrôle de l'effort | Explicite — Non-Thinking, High, Max | Non publié |
| Auto-hébergement | Oui — transformers, vLLM, SGLang, xLLM, ktransformers | Dépend de l'éditeur |
Le bloc programmation est un carton plein pour GLM-5.2, même si trois des quatre marges sont faibles — un à deux points sur SWE-bench Pro et NL2Repo. DeepSWE fait exception à 46.2 contre 18.0, un écart assez large pour suggérer une vraie différence d'exécution de longue haleine plutôt qu'un bruit de mesure. Dans le bloc raisonnement, les modèles se partagent les lignes à moins d'un point sur la plupart des benchmarks, GLM-5.2 étant nettement devant sur CritPt (20.9 contre 13.4) et AIME 2026 (99.2 contre 97.0). Compter les victoires exagère la distance ici. Retirez toutes les lignes décidées à moins d'un point et la comparaison se réduit à trois résultats significatifs : DeepSWE et CritPt pour GLM-5.2, HMMT fév. 2026 pour Qwen3.7-Max. Deux de ces trois récompensent l'exécution soutenue et un récompense la profondeur mathématique, ce qui résume assez bien la façon dont ces deux modèles à poids ouverts diffèrent au quotidien, plutôt que sur un tableau de scores.
| Benchmark | GLM-5.2 | Qwen3.7-Max | Vainqueur |
|---|---|---|---|
| Programmation et horizon long | |||
| SWE-bench Pro | 62.1 | 60.6 | GLM-5.2 |
| NL2Repo | 48.9 | 47.2 | GLM-5.2 |
| DeepSWE | 46.2 | 18.0 | GLM-5.2 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 75.0 | GLM-5.2 |
| Raisonnement et agentique | |||
| MCP-Atlas (public set) | 76.8 | 76.4 | GLM-5.2 |
| HLE | 40.5 | 41.4 | Qwen3.7-Max |
| HLE w/ Tools | 54.7 | 53.5 | GLM-5.2 |
| CritPt | 20.9 | 13.4 | GLM-5.2 |
| AIME 2026 | 99.2 | 97.0 | GLM-5.2 |
| HMMT Nov. 2025 | 94.4 | 95.0 | Qwen3.7-Max |
| HMMT Feb. 2026 | 92.5 | 97.1 | Qwen3.7-Max |
| IMOAnswerBench | 91.0 | 90.0 | GLM-5.2 |
| GPQA-Diamond | 91.2 | 90.0 | GLM-5.2 |
* score sur l'ensemble complet.
Tous les chiffres de cette page sont des résultats tels que publiés par les auteurs du modèle. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.
Voir en détail les 17 benchmarks GLM →Choisissez le modèle GLM quand la tâche a de la longueur. Ses victoires en programmation sont ici étroites sur les problèmes bornés et énormes sur DeepSWE, exactement le schéma attendu d'un modèle entraîné sur de longues trajectoires d'agents de code avec une fenêtre de 1 000 000 de tokens derrière lui.
Qwen3.7-Max est le modèle le plus fort de ce tableau pour les mathématiques et les connaissances générales. Son 97.1 sur HMMT fév. 2026 est une vraie avance, et ses résultats sur HLE et HMMT nov. 2025 devancent GLM-5.2 de fractions de point. Pour une charge de travail dominée par des questions difficiles et autonomes, c'est une alternative sérieuse à poids ouverts.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.