Un modèle GLM est un membre d'une famille de grands modèles de langage à poids ouverts dont le vaisseau amiral actuel est GLM-5.2. Si vous arrivez ici après une recherche du type « qu'est-ce que GLM », la réponse courte est celle-ci : GLM est une lignée de modèles de langage généralistes publiés avec leurs poids sous licence MIT, allant de versions légères à 30B jusqu'à un vaisseau amiral à contexte d'1M de tokens conçu pour l'ingénierie agentique de longue haleine.
Ce qui distingue un LLM GLM de la plupart des modèles que vous pourriez citer, c'est la combinaison de deux choses qui vont rarement ensemble. Il rivalise sur les mêmes benchmarks que la frontière propriétaire — 81.0 sur Terminal-Bench 2.1, 74.4 sur FrontierSWE Dominance, 99.2 sur AIME 2026, chiffres publiés par les auteurs du modèle — et pourtant les poids sont téléchargeables, auto-hébergeables et sous licence permissive. C'est cette combinaison que ce site existe pour documenter.
Un modèle GLM est un grand modèle de langage fondé sur l'architecture transformer : il reçoit du texte, prédit du texte, et a été post-entraîné pour suivre des instructions, utiliser des outils et travailler dans des harnais d'agent. Fonctionnellement, il occupe la même place dans votre architecture que n'importe quel autre LLM généraliste — vous lui envoyez un prompt et il vous renvoie une complétion en streaming. Les différences intéressantes sont architecturales et juridiques plutôt que conceptuelles.
Sur le plan architectural, la génération actuelle utilise une attention sparse avec un indexeur partagé, une conception que les auteurs du modèle appellent IndexShare, de sorte que le calcul par token ne croît pas avec le contexte comme le ferait une attention dense. C'est ce qui rend la fenêtre d'1M de tokens du vaisseau amiral servable en pratique, et pas seulement annonçable. Sur le plan juridique, chaque modèle GLM principal est publié sous MIT sans restriction régionale : vous pouvez le télécharger, l'affiner, le déployer commercialement et garder chaque prompt dans votre propre réseau.
La famille a évolué vite, et il vaut mieux lire ces versions comme une suite de problèmes précis résolus les uns après les autres que comme un numéro de version qui s'incrémente. Chaque entrée ci-dessous renvoie à sa propre fiche technique sur ce site.
Le mot « ouvert » est employé à tort et à travers dans ce secteur : il vaut donc la peine d'être précis sur ce qui est revendiqué pour la famille de modèles GLM. Les poids principaux sont publiés sur HuggingFace et ModelScope sous licence MIT, sans restriction régionale et sans clause d'usage acceptable venant restreindre ce que la licence accorde par ailleurs. En pratique, les poids se comportent donc comme n'importe quel autre artefact sous MIT dans votre pile.
Ce sont les conséquences opérationnelles qui comptent vraiment. Vos prompts ne quittent jamais une infrastructure que vous contrôlez, ce qui règle toute une classe d'objections de gouvernance des données avant même qu'elles ne soient soulevées. Une version de modèle ne peut pas être retirée sous vos pieds, puisque vous détenez déjà les poids. Et vous pouvez affiner sur des données propriétaires sans les envoyer nulle part. Ce sont ces propriétés qui font qu'un LLM GLM ouvert s'évalue différemment d'une API hébergée, même à scores de benchmark comparables.
Commencez par la longueur de contexte, car c'est la contrainte qu'on ne peut pas contourner. Si une tâche doit voir un dépôt entier, une surface d'API complète ou plusieurs jours de logs dans un seul prompt, seul GLM-5.2 dispose d'une fenêtre publiée de 1 000 000 de tokens ; tout le reste de la famille exigera une couche de récupération qui décide à votre place quels fragments le modèle voit. Si vos tâches sont bien délimitées, cette contrainte disparaît et c'est le matériel qui devient le facteur décisif.
Choisissez ensuite selon l'empreinte. GLM-4.7-Flash à 30B et GLM-4.5-Air sont les paliers légers conçus pour l'inférence locale et le travail à fort volume ; GLM-5.1 offre une fenêtre de 200 000 tokens à un coût de KV-cache bien inférieur à celui du vaisseau amiral ; GLM-ASR gère la transcription plutôt que la génération de texte. Le schéma de production sensé consiste à en faire tourner deux — un petit modèle pour le volume et le vaisseau amiral pour les problèmes qui justifient vraiment le calcul.
Tous les chiffres de cette page sont des résultats tels que publiés par les auteurs du modèle. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.