GLM-5.1 — le modèle GLM des tâches longues avant la 5.2

GLM-5.1 est le modèle GLM qui a rendu le travail de longue haleine crédible pour les poids ouverts. Il proposait un contexte de 200 000 tokens, une exécution autonome de plusieurs heures et des livrables de qualité professionnelle à un moment où la plupart des modèles ouverts étaient encore jugés sur des tâches à fichier unique. C'est aussi le seul autre modèle GLM disposant d'une colonne de benchmarks complète publiée, ce qui en fait le point de référence auquel chaque progrès de GLM-5.2 est comparé.

Lire la colonne de GLM-5.1 est le moyen le plus rapide de comprendre ce que la génération suivante a réellement changé. Là où GLM-5.1 affiche 63.5 sur Terminal-Bench 2.1, 58.4 sur SWE-bench Pro et 30.5 sur FrontierSWE Dominance, GLM-5.2 affiche 81.0, 62.1 et 74.4. L'écart est volontairement inégal : la programmation standard a gagné quelques points, l'exécution agentique de longue haleine des dizaines. Tous ces chiffres sont tels que publiés par les auteurs du modèle.

200K
tokens de contexte
le plafond que GLM-5.2 a ensuite porté à un million
63.5
Terminal-Bench 2.1
publié pour GLM-5.1 sous le harnais Terminus-2
30.5
FrontierSWE Dominance
contre 74.4 pour GLM-5.2 sur la même évaluation

Playground IA gratuit — testez un LLM open source en direct

Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.

La réponse s'affichera ici en streaming...

Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.

Ce que couvre une fenêtre de contexte de 200K

Deux cent mille tokens suffisent pour un service substantiel, ses tests et une longue conversation à leur sujet — grosso modo l'ensemble de travail d'une fonctionnalité ciblée, pas d'un monorepo entier. En pratique, GLM-5.1 gère confortablement des tâches agentiques bien délimitées et commence à réclamer une couche de récupération dès qu'une tâche s'étend à de nombreux modules. C'est aussi la fenêtre à laquelle l'ancienne conception de prédiction multi-tokens se heurtait à un décalage de KV-cache entre entraînement et inférence, plafonnant la longueur d'acceptation du décodage spéculatif à 4.56 ; supprimer ce décalage est l'une des corrections précises apportées par la génération suivante. Si votre charge de travail tient dans 200K tokens, GLM-5.1 reste un modèle GLM capable et entièrement ouvert ; sinon, le saut vers la fenêtre 1M est la raison d'être même de GLM-5.2.

Fenêtre de contexte
200 000 tokens
Licence
Open source MIT
Niveaux d'effort
Introduits avec GLM-5.2
Terminal-Bench 2.1
63.5 (Terminus-2)
Hébergement des poids
HuggingFace · ModelScope

Résultats de benchmark de GLM-5.1

Scores tels que publiés par les auteurs du modèle.

La colonne publiée de GLM-5.1 est honorable en raisonnement et en programmation de longueur moyenne : 95.3 sur AIME 2026, 86.2 sur GPQA-Diamond, 83.8 sur IMOAnswerBench, 71.8 sur l'ensemble public MCP-Atlas et 58.4 sur SWE-bench Pro. Là où il manque visiblement de marge, c'est sur le travail à très long horizon — 30.5 sur FrontierSWE Dominance, 20.1 sur PostTrainBench et 1.0 sur SWE-Marathon. Ces trois lignes correspondent précisément aux charges de travail pour lesquelles la génération suivante a été entraînée, d'où des écarts bien plus importants que sur les évaluations de programmation standard.

Voir en détail les 17 benchmarks GLM →

Comment GLM-5.1 se compare

Comparaison sur Terminal-Bench 2.1 (Terminus-2), telle que publiée par les auteurs du modèle.

Sur Terminal-Bench 2.1 sous le harnais Terminus-2, le 63.5 de GLM-5.1 se situe sous Qwen3.7-Max à 75.0 et à peu près au niveau de DeepSeek-V4-Pro à 64.0, tandis que GLM-5.2 domine le champ ouvert à 81.0 et que Claude Opus 4.8 mène à 85.0. Lu comme une lignée, le graphique montre une génération de modèles ouverts regroupés dans le bas des soixante et une version qui s'échappe de cette bande — c'est l'argument le plus net pour considérer GLM-5.2, et non GLM-5.1, comme la référence actuelle en poids ouverts.

Lire la comparaison complète GLM-5.2 vs GLM-5.1 →

La place de GLM-5.1 dans la gamme des modèles GLM

GLM-5.1 a succédé à GLM-5 et GLM-5-Turbo, avant d'être remplacé par GLM-5.2. C'est le dernier modèle GLM sans niveaux d'effort explicites : tout ce que vous construisez dessus dépense une quantité fixe de calcul par tâche, sans possibilité d'ajuster le compromis requête par requête. Il reste un choix raisonnable quand vous voulez une empreinte mémoire plus petite et plus prévisible que celle du vaisseau amiral à contexte 1M et que vos tâches tiennent réellement dans 200K tokens.

Autres modèles GLM

Tout voir

FAQ GLM-5.1

Qu'est-ce que le modèle GLM-5.1 ?
GLM-5.1 est le précédent vaisseau amiral de la famille de modèles GLM : un modèle à poids ouverts sous licence MIT doté d'un contexte de 200 000 tokens, conçu pour le raisonnement de longue haleine et le travail d'ingénierie autonome sur plusieurs heures. C'est l'un des deux seuls modèles GLM disposant d'une colonne de benchmarks complète publiée, avec GLM-5.2.
GLM-5.2 est-il vraiment supérieur à GLM-5.1 ?
Tout dépend de l'évaluation. Sur la programmation standard, l'écart est modeste — SWE-bench Pro passe de 58.4 à 62.1. Sur le travail agentique de longue haleine, il est énorme : FrontierSWE Dominance de 30.5 à 74.4, DeepSWE de 18.0 à 46.2, SWE-Marathon de 1.0 à 13.0. GLM-5.2 remporte toutes les lignes du duel publié.
Quelle est la taille de la fenêtre de contexte de GLM-5.1 ?
200 000 tokens, GLM-5.2 ayant ensuite porté le plafond à un solide 1 000 000. Pour beaucoup de tâches de code agentique c'est suffisant, mais l'analyse à l'échelle d'un dépôt et les boucles de recherche de plusieurs heures sont exactement les cas où la fenêtre plus petite impose la troncature ou la récupération.
GLM-5.1 est-il toujours open source ?
Oui. GLM-5.1 reste un modèle GLM à poids ouverts sous licence MIT, publié sur HuggingFace et ModelScope. Être remplacé ne retire pas une version — les poids que vous avez déjà téléchargés restent utilisables indéfiniment, ce qui est l'un des avantages pratiques des poids ouverts sur une API hébergée.
Y a-t-il encore une raison d'utiliser GLM-5.1 ?
Oui, si vos tâches tiennent dans 200K tokens et que vous voulez une empreinte de service plus petite. Une fenêtre de 200K coûte bien moins de mémoire KV-cache qu'une fenêtre d'un million, et pour du travail bien délimité l'écart publié sur les évaluations de programmation standard n'est que de quelques points. Pour des agents de longue haleine, utilisez plutôt GLM-5.2.

Testez un modèle d'IA en direct, gratuitement et sans compte

Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.