GLM-4.5-Air est la version qui a fait de l'efficacité un objectif de premier plan pour la famille de modèles GLM. C'est un modèle à faible empreinte conçu pour offrir de solides performances pour chaque unité de calcul consommée, plutôt que pour dominer un classement — le palier vers lequel on se tourne quand une charge de travail est à fort volume, sensible à la latence, ou tourne là où un vaisseau amiral ne peut tout simplement pas être déployé.
Cet objectif de conception a bien vieilli. La famille propose désormais une échelle d'efficacité claire — GLM-4.5-Air, puis GLM-4.7-Flash à 30B, puis les versions pleine taille jusqu'au vaisseau amiral GLM-5.2 à contexte 1M — le tout sous la même licence MIT avec des poids chez les mêmes hébergeurs publics. Choisir entre eux est une décision de matériel et de coût de calcul, pas de licence : une position matériellement différente de celle où l'on choisit entre des API hébergées dont les paliers sont aussi des frontières commerciales.
Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.
La réponse s'affichera ici en streaming...
Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.
Les benchmarks de frontière récompensent la capacité à n'importe quel prix, ce qui est l'inverse des contraintes réelles de la plupart des systèmes en production. Si une requête doit répondre en moins d'une seconde, ou si un pipeline doit traiter des millions de documents, la question opérationnelle n'est pas quel modèle obtient le meilleur score mais quel modèle franchit votre seuil de qualité au moindre coût. Un modèle GLM pensé pour l'efficacité change la forme de ce que vous pouvez construire : vous pouvez vous permettre de l'appeler sur chaque élément plutôt que sur un échantillon, l'exécuter dans le chemin d'une requête au lieu d'un traitement nocturne, et garder toute la charge de travail sur votre propre matériel. Le corollaire est de savoir quand c'est le mauvais choix — le travail agentique de longue haleine, le raisonnement à l'échelle d'un dépôt et les problèmes multi-étapes difficiles relèvent du vaisseau amiral, et vouloir les forcer sur un modèle léger produit des tentatives coûteuses plutôt que des économies.
Le tableau comparatif publié couvre GLM-5.2 et GLM-5.1. La colonne ci-dessous est celle de GLM-5.1, montrée uniquement comme point de repère familial. Aucune colonne de benchmarks n'a été publiée pour GLM-4.5-Air, et aucune n'est inventée ici.
GLM-4.5-Air n'a pas de ligne dans le panel de comparaison publié, cette page n'en cite donc aucune pour lui. La colonne de référence est là pour indiquer ce qu'un modèle pleine taille de la génération suivante atteignait, ce qui est la façon honnête de présenter un palier léger : vous échangez une capacité mesurable contre une empreinte de service bien plus faible, et l'ampleur de cet échange doit être mesurée sur votre propre charge de travail.
Comparaison sur HLE (Humanity's Last Exam), telle que publiée par les auteurs du modèle.
HLE est l'évaluation publiée qui sanctionne le plus une capacité limitée. Claude Opus 4.8 mène à 49.8 sur l'ensemble complet, Qwen3.7-Max obtient 41.4, GLM-5.2 40.5, DeepSeek-V4-Pro 37.7 et GLM-5.1 31.0. Même les modèles les plus forts répondent à moins de la moitié des questions, ce qui dit clairement que le raisonnement difficile et ouvert n'est pas la cible d'un modèle léger — dirigez ces tâches vers le vaisseau amiral et gardez Air pour le travail à fort volume pour lequel il a été conçu.
GLM-4.5-Air est le modèle le plus ancien de la gamme présentée sur ce site et l'origine de la lignée efficacité de la famille, poursuivie ensuite par GLM-4.7-Flash à 30B. Au-dessus se trouvent GLM-4.7, GLM-5, GLM-5-Turbo, GLM-5.1 et le vaisseau amiral GLM-5.2. Une architecture sensée utilise les deux extrémités : Air ou Flash pour le volume, GLM-5.2 pour les problèmes qui justifient le calcul. Comme chaque palier partage une licence et un hébergeur de poids, cette répartition ne vous coûte rien contractuellement — vous faites tourner deux points de sauvegarde de la même famille ouverte plutôt que de négocier deux relations fournisseurs distinctes, et vous pouvez déplacer le trafic entre eux dès que vos mesures le suggèrent.
Le vaisseau amiral à contexte d'1M de tokens. Il représente l'état de l'art open source sur les évaluations de programmation et de longue haleine, avec des niveaux d'effort explicites Non-Thinking, High et Max.
Le palier léger à 30B. Assez efficace et rapide pour l'inférence locale, et annoncé comme devançant les modèles ouverts d'échelle comparable.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.