Comment exécuter un modèle GLM en local sur votre propre matériel

Vous pouvez exécuter un modèle GLM en local parce que les poids sont réellement publiés, et non protégés par un formulaire de demande ou un point de terminaison hébergé. Cette page couvre les quatre éléments qui décident du succès d'un déploiement local : la licence sous laquelle vous opérez, l'endroit où vivent les poids, les frameworks de service pris en charge, et la façon de dimensionner le matériel pour la longueur de contexte dont vous avez réellement besoin plutôt que pour le seul nombre de paramètres. Aucun n'est difficile isolément ; c'est de réussir les quatre en même temps que dépend la différence entre un déploiement qui fonctionne et un week-end de débogage.

La raison de s'y intéresser est simple. Un modèle GLM open source tournant sur votre propre matériel garde chaque prompt dans votre réseau, ne peut pas être retiré sous vos pieds, et peut être affiné sur des données que vous n'enverriez jamais à un tiers. Ce sont ces propriétés qui poussent des équipes à choisir des poids ouverts même quand un modèle hébergé obtient quelques points de plus.

La licence : MIT, sans limite régionale

Les poids des modèles GLM principaux sont publiés sous licence MIT, sans restriction régionale. MIT est à peu près aussi permissive qu'une licence logicielle peut l'être : usage, modification, distribution et déploiement commercial, avec attribution et sans garantie. Il n'y a pas de clause d'usage acceptable distincte venant restreindre ce que la licence accorde par ailleurs, ni de clause géographique décidant où vous pouvez la servir.

Cela compte davantage pour des modèles que pour du logiciel ordinaire, car beaucoup de versions nominalement ouvertes comportent des clauses qui rendent le déploiement en production juridiquement ambigu. Vérifiez le fichier de licence livré avec le point de sauvegarde précis que vous téléchargez — c'est le texte qui fait foi, et il se lit en une trentaine de secondes.

Où vivent les poids des modèles GLM

Les poids sont publiés sur HuggingFace et sur ModelScope. Les deux hébergent les points de sauvegarde complets plutôt que des adaptateurs ou des versions partielles : vous pouvez donc les récupérer avec l'outillage standard de l'une ou l'autre plateforme. Répliquer le point de sauvegarde dans votre propre dépôt d'artefacts avant la mise en production est une bonne pratique, pour la même raison que pour les images de conteneurs : votre déploiement ne devrait pas dépendre de la disponibilité d'un hébergeur externe au moment où vous montez en charge.

Cinq frameworks de service pris en charge

Les auteurs du modèle annoncent la prise en charge de cinq piles d'inférence qui, ensemble, couvrent pratiquement toutes les formes de déploiement local, de la station de travail unique au cluster multi-nœuds.

transformers

L'implémentation de référence. La plus lente pour du service en production, mais le moyen le plus simple de confirmer qu'un point de sauvegarde se charge et génère correctement avant d'investir dans une pile plus rapide. Commencez ici pour déboguer.

vLLM

Le choix de production habituel. L'attention paginée et le batching continu le rendent solide sous charge concurrente, et c'est généralement le chemin le plus rapide entre un point de sauvegarde téléchargé et un point de terminaison compatible OpenAI sur votre propre matériel.

SGLang

Optimisé pour la génération structurée et la forte réutilisation de préfixes. Un bon choix quand de nombreuses requêtes partagent un long prompt système ou un préfixe de document commun, ce qui est exactement la forme de la plupart des charges agentiques.

xLLM

Un chemin de service supplémentaire pris en charge et annoncé par les auteurs du modèle, utile lorsque ses caractéristiques de déploiement conviennent mieux à votre infrastructure que les alternatives.

ktransformers

Vise l'inférence hétérogène CPU et GPU, ce qui le rend intéressant pour du matériel contraint : il peut décharger des parties du modèle vers la mémoire système et garder utilisable un grand modèle sur une machine qui ne pourrait pas le contenir autrement.

Dimensionner le matériel pour le contexte, pas seulement pour les paramètres

L'erreur la plus fréquente en déploiement local est de budgéter la mémoire pour les poids en oubliant le KV-cache. Le nombre de paramètres fixe un plancher, mais le cache croît avec la longueur de contexte et la concurrence, et à long contexte il domine. C'est le même mur que les auteurs du modèle ont rencontré en servant le vaisseau amiral : au-delà de quelques centaines de milliers de tokens, le goulot d'étranglement cesse d'être le calcul pour devenir la capacité du cache, l'efficacité des kernels et la surcharge CPU.

La conséquence pratique est qu'il faut dimensionner pour votre distribution réelle de contextes, et non pour le maximum que le modèle supporte. Faire tourner GLM-5.2 avec une fenêtre de 128K est une proposition matérielle très différente de le faire tourner au million complet, et la plupart des charges de travail n'approchent jamais le plafond. Si votre matériel est juste, les paliers légers GLM-4.7-Flash et GLM-4.5-Air, ou GLM-5.1 à contexte 200K, tiendront là où le vaisseau amiral ne tiendra pas.

Quel modèle GLM exécuter en local

Adaptez le modèle à la machine. Sur un accélérateur de station de travail unique, GLM-4.7-Flash à 30B ou GLM-4.5-Air sont les options réalistes et sont parfaitement capables pour la classification, l'extraction, le résumé et les modifications de code de routine. Sur un nœud multi-GPU sérieux, GLM-5.1 vous offre une fenêtre de 200 000 tokens à un coût de cache bien inférieur à celui du vaisseau amiral. Sur un cluster, GLM-5.2 vous donne le contexte 1M complet, des niveaux d'effort explicites et la meilleure colonne de benchmarks publiée de la famille. Pour de la transcription plutôt que de la génération, GLM-ASR assure l'étape de reconnaissance sous la même licence.

Parcourir tous les modèles GLM →

Tous les chiffres de cette page sont des résultats tels que publiés par les auteurs du modèle. glmmodel.com les rapporte ; il n'exécute pas ces évaluations.

FAQ exécuter GLM en local

Puis-je exécuter un modèle GLM en local ?
Oui. Les poids des modèles GLM principaux sont sous licence MIT, sans restriction régionale, et publiés sur HuggingFace et ModelScope, et l'inférence locale est prise en charge via transformers, vLLM, SGLang, xLLM et ktransformers.
Quel matériel faut-il pour exécuter un modèle GLM en local ?
Cela dépend bien plus de la longueur de contexte que du nombre de paramètres. Les poids fixent un plancher mémoire, mais le KV-cache croît avec le contexte et la concurrence et domine à long contexte. Dimensionnez pour votre distribution réelle de contextes plutôt que pour le maximum du modèle.
Quel framework de service utiliser ?
vLLM pour la plupart des mises en production, SGLang quand de nombreuses requêtes partagent un long préfixe, ktransformers quand vous avez besoin de décharger sur le CPU pour tenir sur du matériel contraint, et transformers tel quel pour déboguer un premier chargement. Les cinq sont annoncés comme pris en charge par les auteurs du modèle.
Quel est le plus petit modèle GLM que je puisse exécuter ?
GLM-4.7-Flash, avec 30B de paramètres, est le palier léger de la famille, GLM-4.5-Air étant la version d'efficacité antérieure. Les deux sont sous licence MIT et tournent sur les mêmes frameworks que le vaisseau amiral : passer d'un palier à l'autre est une décision matérielle plutôt que juridique.
Puis-je exécuter la fenêtre de contexte 1M complète en local ?
Architecturalement oui, pratiquement seulement avec beaucoup de mémoire. Un KV-cache d'un million de tokens est un engagement lourd, c'est pourquoi la plupart des déploiements auto-hébergés utilisent une fenêtre plus courte avec les mêmes poids et réservent le contexte complet aux cas qui l'exigent vraiment.

Testez un modèle d'IA en direct, gratuitement et sans compte

Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.