GLM-5-Turbo est le modèle GLM de la série 5 spécifiquement optimisé pour le travail d'agents à longue chaîne : des trajectoires où le plan est revu sans cesse, où les outils renvoient des sorties inattendues et où l'exécution doit rester réalisable pendant des dizaines, voire des centaines de tours. Il reprend la base GLM-5 et l'optimise pour ce schéma dynamique plutôt que pour des réponses en un coup.
L'exécution à longue chaîne est un problème différent de la qualité de raisonnement brute. Un modèle peut exceller sur une question difficile isolée et s'effondrer sur cinquante tours parce qu'il perd le fil de ce qu'il a déjà essayé, laisse discrètement tomber une contrainte ou reformule l'objectif à mi-parcours. GLM-5-Turbo existe parce que ce mode de défaillance est précisément ce qui bloque les agents en production, et c'est le trait que la série 5 a transmis à GLM-5.1 puis à GLM-5.2.
Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.
La réponse s'affichera ici en streaming...
Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.
Un scénario d'agent à longue chaîne est un scénario où le modèle ne reçoit pas une tâche pour renvoyer une réponse : il reçoit un objectif, appelle un outil, lit un résultat qu'il n'avait pas prévu, révise son plan et recommence. Les modes de défaillance sont précis : répéter une action qui a déjà échoué, perdre une contrainte énoncée quarante tours plus tôt, ou produire une étape de plan que le harnais ne peut pas exécuter. Optimiser pour ce schéma revient à travailler le comportement au niveau de la trajectoire plutôt que la fluidité au niveau du tour — garder l'objectif stable, garder les appels d'outils bien formés, et se remettre d'un résultat inattendu au lieu de tout reprendre. C'est la propriété autour de laquelle GLM-5-Turbo a été conçu, et c'est pourquoi le même fil conducteur se retrouve dans le vaisseau amiral à contexte 1M, entraîné sur de longues trajectoires d'agents de code exactement pour la même raison.
Le tableau comparatif publié couvre GLM-5.2 et GLM-5.1. La colonne ci-dessous est celle de GLM-5.1 — le point de référence publié le plus proche de la génération GLM-5. Aucune colonne de benchmarks n'a été publiée pour GLM-5-Turbo lui-même.
Il n'existe pas de ligne publiée pour GLM-5-Turbo, ce site n'en cite donc aucune. Ce que la colonne de référence montre, c'est où la génération environnante se situait en évaluation agentique : 71.8 sur l'ensemble public MCP-Atlas et 40.7 sur Tool-Decathlon pour GLM-5.1, contre 76.8 et 48.2 pour GLM-5.2. L'usage agentique d'outils est la famille de benchmarks la plus proche de ce pour quoi Turbo a été optimisé, et c'est l'un des domaines où le vaisseau amiral a progressé le plus régulièrement.
Comparaison sur l'ensemble public MCP-Atlas, telle que publiée par les auteurs du modèle.
MCP-Atlas est le meilleur indicateur publié du comportement en chaîne longue avec outils, et le peloton est serré : Claude Opus 4.8 à 77.8, GLM-5.2 à 76.8, GPT-5.5 à 75.3, GLM-5.1 à 71.8 et Gemini 3.1 Pro à 69.2. Un point d'écart avec la frontière propriétaire sur l'usage agentique d'outils, c'est une tout autre image que les dix points d'écart observés sur certaines lignes de programmation standard — et c'est l'argument le plus fort en faveur d'un modèle GLM à poids ouverts dans un harnais d'agent.
GLM-5-Turbo est un frère de GLM-5 plutôt qu'un successeur, et tous deux ont été remplacés par GLM-5.1 puis GLM-5.2. Si l'exécution d'agents à longue chaîne est votre charge de travail, le vaisseau amiral hérite de tout ce pour quoi Turbo a été conçu et y ajoute une fenêtre d'1M de tokens ainsi que des niveaux d'effort explicites : c'est donc la version sur laquelle bâtir aujourd'hui.
La version qui a ouvert la série 5 : des fondamentaux de programmation renforcés, une exécution multi-étapes plus fiable et un comportement nettement meilleur sur les tâches d'agent complexes.
Le vaisseau amiral à contexte d'1M de tokens. Il représente l'état de l'art open source sur les évaluations de programmation et de longue haleine, avec des niveaux d'effort explicites Non-Thinking, High et Max.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.