Jak uruchomić model GLM lokalnie na własnym sprzęcie

Model GLM możesz uruchomić lokalnie, bo wagi są naprawdę opublikowane, a nie ukryte za formularzem wniosku czy hostowanym endpointem. Ta strona omawia cztery rzeczy przesądzające o powodzeniu lokalnego wdrożenia: licencję, na której działasz, miejsce, gdzie leżą wagi, wspierane frameworki serwujące oraz sposób doboru sprzętu do długości kontekstu, której faktycznie potrzebujesz, a nie do samej liczby parametrów. Żadna z nich nie jest trudna z osobna; to trafienie we wszystkie cztery naraz odróżnia działające wdrożenie od weekendu spędzonego na debugowaniu.

Powód, by się tym zająć, jest prosty. Otwartoźródłowy model GLM działający na Twoim sprzęcie trzyma każdy prompt we własnej sieci, nie może zostać wycofany spod Twoich nóg i można go dostroić na danych, których nigdy nie wysłałbyś do podmiotu trzeciego. Właśnie dlatego zespoły wybierają otwarte wagi, nawet gdy model hostowany punktuje o kilka punktów wyżej.

Licencja: MIT, bez ograniczeń regionalnych

Podstawowe wagi modeli GLM są wydawane na licencji MIT bez ograniczeń regionalnych. MIT jest mniej więcej tak permisywna, jak tylko może być licencja oprogramowania: używanie, modyfikowanie, dystrybucja i komercyjne wdrażanie, z zastrzeżeniem autorstwa i bez gwarancji. Nie ma osobnej klauzuli dopuszczalnego użycia zawężającej to, co licencja skądinąd przyznaje, ani klauzuli geograficznej decydującej, gdzie wolno Ci ją serwować.

W przypadku modeli ma to większe znaczenie niż przy zwykłym oprogramowaniu, bo wiele nominalnie otwartych wydań zawiera klauzule czyniące wdrożenie produkcyjne prawnie niejednoznacznym. Sprawdź plik licencji dołączony do konkretnego checkpointu, który pobierasz — to tekst wiążący, a przeczytanie go zajmuje jakieś trzydzieści sekund.

Gdzie leżą wagi modeli GLM

Wagi są publikowane na HuggingFace i na ModelScope. Oba serwisy hostują pełne checkpointy, a nie adaptery czy wydania częściowe, więc możesz je pobrać standardowymi narzędziami dowolnej z tych platform. Skopiowanie checkpointu do własnego repozytorium artefaktów przed wdrożeniem to dobra praktyka z tego samego powodu co przy obrazach kontenerów: Twoje wdrożenie nie powinno zależeć od dostępności zewnętrznego hosta w momencie skalowania.

Pięć wspieranych frameworków serwujących

Autorzy modelu wymieniają wsparcie dla pięciu stosów inferencyjnych, które razem pokrywają praktycznie każdy kształt lokalnego wdrożenia, od pojedynczej stacji roboczej po klaster wielowęzłowy.

transformers

Implementacja referencyjna. Najwolniejsza w serwowaniu produkcyjnym, ale najprostszy sposób, by potwierdzić, że checkpoint wczytuje się i generuje poprawnie, zanim zainwestujesz w szybszy stos. Zacznij tutaj przy debugowaniu.

vLLM

Typowy wybór produkcyjny. Paged attention i ciągłe batchowanie czynią go mocnym przy równoległym obciążeniu, a zwykle jest to najszybsza droga od pobranego checkpointu do endpointu zgodnego z OpenAI na własnym sprzęcie.

SGLang

Zoptymalizowany pod generowanie strukturalne i intensywne ponowne wykorzystanie prefiksów. Warto go wybrać, gdy wiele żądań dzieli długi prompt systemowy albo wspólny prefiks dokumentu, czyli dokładnie wtedy, gdy obciążenie ma kształt typowy dla agentów.

xLLM

Dodatkowa wspierana ścieżka serwowania wymieniana przez autorów modelu, przydatna tam, gdzie jej charakterystyka wdrożeniowa pasuje do Twojej infrastruktury lepiej niż alternatywy.

ktransformers

Celuje w heterogeniczną inferencję na CPU i GPU, co czyni go ciekawym przy ograniczonym sprzęcie: potrafi przenieść części modelu do pamięci systemowej i utrzymać duży model użytecznym na maszynie, która inaczej by go nie pomieściła.

Dobieranie sprzętu do kontekstu, nie tylko do parametrów

Najczęstszym błędem lokalnego wdrożenia jest zaplanowanie pamięci na wagi i zapomnienie o KV-cache. Liczba parametrów wyznacza dolną granicę, ale cache skaluje się z długością kontekstu i współbieżnością, a przy długim kontekście dominuje. To ta sama ściana, o którą uderzyli autorzy modelu przy serwowaniu flagowca: powyżej kilkuset tysięcy tokenów wąskim gardłem przestają być obliczenia, a stają się pojemność cache, efektywność kerneli i narzut CPU.

Praktyczna konsekwencja jest taka, że sprzęt powinieneś dobierać do swojego rzeczywistego rozkładu kontekstu, a nie do maksimum obsługiwanego przez model. Uruchamianie GLM-5.2 z oknem 128K to zupełnie inna propozycja sprzętowa niż praca na pełnym milionie, a większość obciążeń nigdy nie zbliża się do limitu. Jeśli Twój sprzęt jest ograniczony, lekkie warstwy GLM-4.7-Flash i GLM-4.5-Air albo GLM-5.1 z kontekstem 200K zmieszczą się tam, gdzie flagowiec się nie zmieści.

Który model GLM uruchomić lokalnie

Dopasuj model do maszyny. Na pojedynczym akceleratorze w stacji roboczej realnymi opcjami są 30B GLM-4.7-Flash albo GLM-4.5-Air, w zupełności wystarczające do klasyfikacji, ekstrakcji, streszczania i rutynowych edycji kodu. Na porządnym węźle wielo-GPU GLM-5.1 daje okno 200 000 tokenów przy znacznie mniejszym koszcie cache niż flagowiec. Na klastrze GLM-5.2 daje pełny kontekst 1M, jawne poziomy wysiłku i najmocniejszą opublikowaną kolumnę benchmarków w rodzinie. Do zamiany mowy na tekst zamiast generowania GLM-ASR obsłuży etap transkrypcji na tej samej licencji.

Przeglądaj wszystkie modele GLM →

Wszystkie liczby na tej stronie to wyniki opublikowane przez autorów modelu. glmmodel.com je raportuje; nie przeprowadza tych ewaluacji.

FAQ: GLM lokalnie

Czy mogę uruchomić model GLM lokalnie?
Tak. Podstawowe wagi modeli GLM są objęte licencją MIT bez ograniczeń regionalnych i opublikowane na HuggingFace oraz ModelScope, a lokalna inferencja jest wspierana przez transformers, vLLM, SGLang, xLLM i ktransformers.
Jakiego sprzętu potrzebuję, by uruchomić model GLM lokalnie?
Zależy to znacznie bardziej od długości kontekstu niż od liczby parametrów. Wagi wyznaczają dolną granicę pamięci, ale KV-cache skaluje się z kontekstem i współbieżnością, a przy długim kontekście dominuje. Dobieraj sprzęt do swojego rzeczywistego rozkładu kontekstu, a nie do maksimum modelu.
Którego frameworka serwującego użyć?
vLLM do większości wdrożeń produkcyjnych, SGLang gdy wiele żądań dzieli długi prefiks, ktransformers gdy potrzebujesz offloadu na CPU przy ograniczonym sprzęcie, a zwykłe transformers do debugowania pierwszego wczytania. Wszystkie pięć jest wymienione jako wspierane przez autorów modelu.
Jaki jest najmniejszy model GLM, który mogę uruchomić?
GLM-4.7-Flash o 30 mld parametrów to lekka warstwa rodziny, a GLM-4.5-Air to wcześniejsze wydanie wydajnościowe. Oba są na licencji MIT i działają na tych samych frameworkach co flagowiec, więc przechodzenie między warstwami jest decyzją sprzętową, a nie licencyjną.
Czy mogę uruchomić lokalnie pełne okno kontekstu 1M?
Architektonicznie tak, praktycznie tylko przy sporej pamięci. KV-cache dla miliona tokenów to duże zobowiązanie, dlatego większość wdrożeń self-hosted pracuje na krótszym oknie z tymi samymi wagami i rezerwuje pełny kontekst dla przypadków, które naprawdę go wymagają.

Wypróbuj działający model AI za darmo — bez konta

Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.