GLM-5.1 est le modèle GLM qui a rendu le travail de longue haleine crédible pour les poids ouverts. Il proposait un contexte de 200 000 tokens, une exécution autonome de plusieurs heures et des livrables de qualité professionnelle à un moment où la plupart des modèles ouverts étaient encore jugés sur des tâches à fichier unique. C'est aussi le seul autre modèle GLM disposant d'une colonne de benchmarks complète publiée, ce qui en fait le point de référence auquel chaque progrès de GLM-5.2 est comparé.
Lire la colonne de GLM-5.1 est le moyen le plus rapide de comprendre ce que la génération suivante a réellement changé. Là où GLM-5.1 affiche 63.5 sur Terminal-Bench 2.1, 58.4 sur SWE-bench Pro et 30.5 sur FrontierSWE Dominance, GLM-5.2 affiche 81.0, 62.1 et 74.4. L'écart est volontairement inégal : la programmation standard a gagné quelques points, l'exécution agentique de longue haleine des dizaines. Tous ces chiffres sont tels que publiés par les auteurs du modèle.
Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.
La réponse s'affichera ici en streaming...
Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.
Deux cent mille tokens suffisent pour un service substantiel, ses tests et une longue conversation à leur sujet — grosso modo l'ensemble de travail d'une fonctionnalité ciblée, pas d'un monorepo entier. En pratique, GLM-5.1 gère confortablement des tâches agentiques bien délimitées et commence à réclamer une couche de récupération dès qu'une tâche s'étend à de nombreux modules. C'est aussi la fenêtre à laquelle l'ancienne conception de prédiction multi-tokens se heurtait à un décalage de KV-cache entre entraînement et inférence, plafonnant la longueur d'acceptation du décodage spéculatif à 4.56 ; supprimer ce décalage est l'une des corrections précises apportées par la génération suivante. Si votre charge de travail tient dans 200K tokens, GLM-5.1 reste un modèle GLM capable et entièrement ouvert ; sinon, le saut vers la fenêtre 1M est la raison d'être même de GLM-5.2.
Scores tels que publiés par les auteurs du modèle.
La colonne publiée de GLM-5.1 est honorable en raisonnement et en programmation de longueur moyenne : 95.3 sur AIME 2026, 86.2 sur GPQA-Diamond, 83.8 sur IMOAnswerBench, 71.8 sur l'ensemble public MCP-Atlas et 58.4 sur SWE-bench Pro. Là où il manque visiblement de marge, c'est sur le travail à très long horizon — 30.5 sur FrontierSWE Dominance, 20.1 sur PostTrainBench et 1.0 sur SWE-Marathon. Ces trois lignes correspondent précisément aux charges de travail pour lesquelles la génération suivante a été entraînée, d'où des écarts bien plus importants que sur les évaluations de programmation standard.
Comparaison sur Terminal-Bench 2.1 (Terminus-2), telle que publiée par les auteurs du modèle.
Sur Terminal-Bench 2.1 sous le harnais Terminus-2, le 63.5 de GLM-5.1 se situe sous Qwen3.7-Max à 75.0 et à peu près au niveau de DeepSeek-V4-Pro à 64.0, tandis que GLM-5.2 domine le champ ouvert à 81.0 et que Claude Opus 4.8 mène à 85.0. Lu comme une lignée, le graphique montre une génération de modèles ouverts regroupés dans le bas des soixante et une version qui s'échappe de cette bande — c'est l'argument le plus net pour considérer GLM-5.2, et non GLM-5.1, comme la référence actuelle en poids ouverts.
GLM-5.1 a succédé à GLM-5 et GLM-5-Turbo, avant d'être remplacé par GLM-5.2. C'est le dernier modèle GLM sans niveaux d'effort explicites : tout ce que vous construisez dessus dépense une quantité fixe de calcul par tâche, sans possibilité d'ajuster le compromis requête par requête. Il reste un choix raisonnable quand vous voulez une empreinte mémoire plus petite et plus prévisible que celle du vaisseau amiral à contexte 1M et que vos tâches tiennent réellement dans 200K tokens.
Le vaisseau amiral à contexte d'1M de tokens. Il représente l'état de l'art open source sur les évaluations de programmation et de longue haleine, avec des niveaux d'effort explicites Non-Thinking, High et Max.
La version qui a ouvert la série 5 : des fondamentaux de programmation renforcés, une exécution multi-étapes plus fiable et un comportement nettement meilleur sur les tâches d'agent complexes.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.