GLM-5.2 est le modèle GLM phare à poids ouverts, conçu pour mener à terme des tâches de longue haleine et pour le code agentique plutôt que pour la conversation en un tour. C'est la version qui a fait passer le contexte utilisable de la famille de 200 000 à un solide million de tokens, introduit des niveaux d'effort explicites et reconstruit la pile d'attention sparse autour d'un indexeur partagé. Pour une équipe qui évalue des alternatives à poids ouverts face à la frontière propriétaire, c'est le modèle GLM qui rivalise réellement sur les évaluations qui comptent pour elle — et il le fait sous licence MIT, avec des poids publiés ouvertement.
Comparé à son prédécesseur GLM-5.1, GLM-5.2 n'est pas une simple mise à jour incrémentale. Terminal-Bench 2.1 passe de 63.5 à 81.0, DeepSWE de 18.0 à 46.2 et FrontierSWE Dominance de 30.5 à 74.4 — tous ces chiffres étant publiés par les auteurs du modèle et aucun mesuré ici. La conséquence pratique : un agent de code peut garder un dépôt entier, ses sorties de tests et ses propres tentatives précédentes dans une même trajectoire, au lieu d'en relire des fragments via une couche de récupération.
Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.
La réponse s'affichera ici en streaming...
Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.
Un contexte d'un million de tokens change ce que vous construisez, pas seulement la quantité de texte que vous pouvez coller. Au lieu d'un pipeline de récupération qui alimente le modèle avec de petits extraits lacunaires, vous pouvez charger un dépôt entier, une référence d'API complète ou plusieurs jours de logs dans un seul prompt et laisser le modèle raisonner sur l'ensemble d'un coup. C'est ce qui rend visibles les dépendances inter-fichiers et les défaillances systémiques : le bug qui n'apparaît que lorsque la frontière de service, la migration et la fixture de test sont toutes sous les yeux en même temps. GLM-5.2 a été entraîné sur des trajectoires d'agents de code à long contexte couvrant l'implémentation à grande échelle, la recherche automatisée, l'optimisation des performances et le débogage complexe : c'est pourquoi les auteurs du modèle décrivent la fenêtre comme solide et non simplement acceptée — la qualité est censée tenir loin dans le contexte au lieu de se dégrader dès qu'une exécution devient confuse.
Scores tels que publiés par les auteurs du modèle.
La colonne publiée de GLM-5.2 est la plus forte exactement là où le modèle a été conçu pour l'être : le code agentique et l'exécution de longue haleine. Il affiche 81.0 sur Terminal-Bench 2.1 sous le harnais Terminus-2 et 82.7 sous Claude Code, 76.8 sur l'ensemble public MCP-Atlas, et 74.4 sur FrontierSWE Dominance, où les tâches individuelles durent jusqu'à vingt heures. En raisonnement pur, il rapporte 99.2 sur AIME 2026 et 91.2 sur GPQA-Diamond. Sur les trois évaluations de longue haleine — FrontierSWE, PostTrainBench et SWE-Marathon — il est le modèle open source le mieux classé du panel de comparaison publié.
Comparaison sur SWE-bench Pro, telle que publiée par les auteurs du modèle.
Sur SWE-bench Pro, le 62.1 de GLM-5.2 reste derrière les 69.2 de Claude Opus 4.8 mais dépasse GPT-5.5 à 58.6 et Gemini 3.1 Pro à 54.2 — et il devance son propre prédécesseur GLM-5.1 à 58.4. Ce schéma se répète dans tout le tableau : la frontière propriétaire mène encore plusieurs évaluations de programmation standard, tandis que GLM-5.2 domine le champ des poids ouverts et remporte certaines lignes de haute lutte, dont Terminal-Bench 2.1 sous le harnais Claude Code (82.7 contre 78.9) et AIME 2026 (99.2 contre 95.7).
GLM-5.2 est aujourd'hui à la tête d'une lignée qui va de GLM-4.5-Air et GLM-4.7 à GLM-5, GLM-5-Turbo et GLM-5.1. Chaque étape a porté une priorité différente — GLM-4.7 sur la programmation et la génération front-end, GLM-5-Turbo sur l'exécution d'agents à longue chaîne, GLM-5.1 sur le travail autonome de plusieurs heures — et GLM-5.2 réunit ces acquis dans un seul modèle doté d'une fenêtre bien plus grande. Si votre budget matériel exclut le vaisseau amiral, les paliers légers GLM-4.7-Flash et GLM-4.5-Air appartiennent à la même famille sous la même licence MIT.
Le précédent vaisseau amiral. Il a apporté à la famille ses premiers grands gains sur les tâches longues et reste la référence à laquelle chaque progrès de GLM-5.2 est mesuré.
Un modèle de base de la série 5 optimisé pour les scénarios d'agents dynamiques à longue chaîne, où le plan change sans cesse et où la trajectoire doit rester exécutable.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.