GLM vs Gemini 3.1 Pro est la comparaison la plus déséquilibrée de ce site, et elle l'est en faveur du modèle à poids ouverts. Sur 19 évaluations publiées, GLM-5.2 en remporte 15, dont absolument toutes les lignes de programmation et de longue haleine, tandis que les victoires de Gemini 3.1 Pro se concentrent sur une bande étroite de benchmarks de raisonnement à forte teneur en connaissances.
Cette configuration mérite d'être énoncée franchement plutôt qu'enrobée : ce sont deux modèles optimisés pour des choses différentes. Tous les chiffres sont des résultats tels que publiés par les auteurs du modèle et reproduits ici sans modification ; glmmodel.com n'exécute pas ces évaluations. Les pastilles de victoire sont de l'arithmétique sur les chiffres publiés.
GLM-5.2 remporte 15 des 19 lignes publiées face à Gemini 3.1 Pro, et le bloc programmation est un carton plein — FrontierSWE Dominance 74.4 contre 39.6, DeepSWE 46.2 contre 10.0, ProgramBench 63.7 contre 39.5, NL2Repo 48.9 contre 33.4, SWE-bench Pro 62.1 contre 54.2 et Terminal-Bench 2.1 81.0 contre 74.0. Les quatre victoires de Gemini 3.1 Pro sont HLE (45.0 contre 40.5), GPQA-Diamond (94.3 contre 91.2), HMMT nov. 2025 pour quatre dixièmes et Tool-Decathlon pour six dixièmes. Si votre travail est de l'ingénierie logicielle, les données publiées pointent nettement vers le modèle GLM ; s'il s'agit de connaissances académiques générales, Gemini conserve un avantage.
Comme dans les autres comparaisons face à des poids fermés, la différence structurelle est la propriété. GLM-5.2 publie une fenêtre de 1 000 000 de tokens et des poids sous licence MIT qui tournent sur la pile d'inférence ouverte standard. Gemini 3.1 Pro est un modèle propriétaire hébergé ; son plafond de contexte est hors du panel de comparaison publié sur lequel s'appuie ce site, et le tableau le consigne au lieu d'estimer.
| Caractéristique | GLM-5.2 | Gemini 3.1 Pro |
|---|---|---|
| Fenêtre de contexte | 1 000 000 de tokens | Non publié |
| Ouverture | Poids ouverts | API fermée |
| Licence | Licence MIT | Propriétaire |
| Contrôle de l'effort | Explicite — Non-Thinking, High, Max | Implicite |
| Auto-hébergement | Oui — transformers, vLLM, SGLang, xLLM, ktransformers | Non — API hébergée uniquement |
Le bloc programmation et longue haleine se passe de commentaire : neuf lignes, neuf victoires pour GLM-5.2, plusieurs de plus de vingt points. Le bloc raisonnement et agentique est réellement partagé. Gemini mène sur HLE et GPQA-Diamond, qui récompensent une large culture académique, et devance HMMT nov. 2025 et Tool-Decathlon de fractions de point. GLM-5.2 prend AIME 2026, HMMT fév. 2026, CritPt, IMOAnswerBench, HLE avec outils et l'ensemble agentique MCP-Atlas. La répartition est cohérente plutôt qu'arbitraire. Les benchmarks qui demandent de restituer et d'appliquer une large connaissance factuelle en une passe favorisent Gemini 3.1 Pro ; ceux qui demandent de planifier, d'exécuter, de lire des sorties d'outils et de corriger sur de nombreux tours favorisent GLM-5.2, et plus la trajectoire est longue, plus l'écart se creuse. Déterminer à laquelle de ces deux formes ressemble votre propre travail est plus utile que d'additionner les victoires.
| Benchmark | GLM-5.2 | Gemini 3.1 Pro | Vainqueur |
|---|---|---|---|
| Programmation et horizon long | |||
| FrontierSWE Dominance | 74.4 | 39.6 | GLM-5.2 |
| PostTrainBench | 34.3 | 21.6 | GLM-5.2 |
| SWE-Marathon | 13.0 | 4.0 | GLM-5.2 |
| SWE-bench Pro | 62.1 | 54.2 | GLM-5.2 |
| NL2Repo | 48.9 | 33.4 | GLM-5.2 |
| ProgramBench | 63.7 | 39.5 | GLM-5.2 |
| DeepSWE | 46.2 | 10.0 | GLM-5.2 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 74.0 | GLM-5.2 |
| Terminal-Bench 2.1 (best harness) | 82.7 | 70.7 | GLM-5.2 |
| Raisonnement et agentique | |||
| MCP-Atlas (public set) | 76.8 | 69.2 | GLM-5.2 |
| Tool-Decathlon | 48.2 | 48.8 | Gemini 3.1 Pro |
| HLE | 40.5 | 45.0 | Gemini 3.1 Pro |
| HLE w/ Tools | 54.7 | 51.4 | GLM-5.2 |
| AIME 2026 | 99.2 | 98.2 | GLM-5.2 |
| HMMT Nov. 2025 | 94.4 | 94.8 | Gemini 3.1 Pro |
| HMMT Feb. 2026 | 92.5 | 87.3 | GLM-5.2 |
| CritPt | 20.9 | 17.7 | GLM-5.2 |
| IMOAnswerBench | 91.0 | 81.0 | GLM-5.2 |
| GPQA-Diamond | 91.2 | 94.3 | Gemini 3.1 Pro |
* score sur l'ensemble complet.
Tous les chiffres de cette page sont des résultats tels que publiés par les auteurs du modèle. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.
Voir en détail les 17 benchmarks GLM →Sur ces données publiées, l'ingénierie logicielle n'est pas un choix serré. Toutes les lignes de programmation et de longue haleine reviennent au modèle GLM, souvent avec une large marge, et il ajoute par-dessus une fenêtre de contexte de 1 000 000 de tokens et des poids ouverts. Pour les charges agentiques, il mène également l'ensemble public MCP-Atlas 76.8 contre 69.2.
Les avantages de Gemini 3.1 Pro ici sont réels mais étroits. Il mène HLE 45.0 contre 40.5 et GPQA-Diamond 94.3 contre 91.2 — deux benchmarks qui récompensent une connaissance factuelle large, de niveau universitaire, plutôt que l'exécution sur une longue trajectoire. Si c'est ce que vous achetez, c'est le modèle le plus fort de ce tableau.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.