GLM Model — otwarty model AI z kontekstem 1M do pracy długodystansowej

GLM-5.2 to flagowy model GLM z otwartymi wagami: solidny kontekst 1M tokenów, poziomy wysiłku Non-Thinking / High / Max oraz raportowane wyniki 81,0 w Terminal-Bench 2.1 i 74,4 w FrontierSWE. Porównaj poniżej wszystkie modele GLM — albo najpierw wypróbuj darmowy playground AI.

1M
tokenów kontekstu
zwiększony z 200K, stabilny przy obciążeniach agentowych
81.0
Terminal-Bench 2.1
raportowane dla GLM-5.2, wobec 63,5 dla GLM-5.1
MIT
licencja open source
otwarte wagi, bez ograniczeń regionalnych

Darmowy playground AI — wypróbuj otwartoźródłowy LLM na żywo

Bez rejestracji, bez konta, bez kredytów. Wpisz prompt i odbierz strumieniowaną odpowiedź.

Odpowiedź pojawi się tutaj...

Ten playground korzysta z darmowego otwartoźródłowego LLM udostępnianego przez OpenRouter. To nie jest GLM-5.2 i nie używa wag GLM — jest tutaj po to, byś mógł przetestować działający model na żywo podczas lektury opublikowanych danych benchmarkowych GLM poniżej.

W czym rodzina modeli GLM jest najlepsza

Cztery zdolności definiują obecną generację modeli GLM — wszystkie raportowane przez autorów modelu i odtwarzalne z otwartych wag.

Solidny kontekst 1M

Kontekst 1M tokenów, który pozostaje użyteczny, a nie tylko akceptowany: GLM-5.2 był trenowany na długokontekstowych trajektoriach agentów programistycznych obejmujących wdrożenia na dużą skalę, zautomatyzowane badania i złożone debugowanie.

Elastyczne poziomy wysiłku

Non-Thinking, High i Max pozwalają wymieniać opóźnienie na możliwości w zależności od zadania — od około 63% przy ~35K tokenów wyjściowych do 74% przy ~83K w ewaluacjach agentowego kodowania.

Architektura IndexShare

Jeden lekki indekser współdzielony przez każde cztery warstwy sparse attention obniża liczbę FLOP-ów na token 2,9× przy długości kontekstu 1M, bez utraty jakości na dużych dystansach.

Otwarte wagi na licencji MIT

Otwartoźródłowy model GLM na licencji MIT: wagi na HuggingFace i ModelScope, bez ograniczeń regionalnych, z lokalnym serwowaniem przez transformers, vLLM, SGLang, xLLM i ktransformers.

Benchmarki GLM 5.2: wyniki w pracy długodystansowej

Wszystkie poniższe liczby to wyniki opublikowane przez autorów modelu dla GLM-5.2 i jego zestawu porównawczego. glmmodel.com je raportuje; nie przeprowadza tych ewaluacji.

Najlepszy model open source
74.4%

FrontierSWE

Dominacja, zadania trwające do 20 godzin

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
2. miejsce ogółem
34.3%

PostTrainBench

Do 10 godzin na pojedynczym H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
2. miejsce za serią Opus
13.0%

SWE-Marathon

Ultradługi horyzont SWE, do 10 godzin

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

We wszystkich trzech benchmarkach długodystansowych GLM-5.2 jest najwyżej sklasyfikowanym modelem open source — dowód, że jego kontekst 1M przekłada się na wykonaną pracę, a nie tylko na zaakceptowane tokeny. Ustępuje Opus 4.8 o jeden punkt w FrontierSWE, wyprzedza GPT-5.5 o jeden i wyprzedza poprzednią generację Opus 4.7 o jedenaście.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Wyniki modeli GLM w 17 benchmarkach

Opublikowane wyniki benchmarków modeli GLM — 17 ewaluacji dla 8 modeli.

Opublikowane wyniki benchmarków modeli GLM dla każdej ewaluacji i każdego modelu
BenchmarkGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Rozumowanie
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Kodowanie
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agentowe
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* wynik na pełnym zestawie.

Poziomy wysiłku: Non-Thinking, High i Max

Model GLM nie ma jednej prędkości. Kontrola poziomu wysiłku pozwala przeznaczyć więcej obliczeń wyłącznie na zadania, które tego wymagają.

Non-Thinking

~63%

~35K śr. tokenów

Szybkie edycje, kod szablonowy, rutynowe refaktoryzacje — wszędzie tam, gdzie opóźnienie liczy się bardziej niż głębia.

Najczęściej używany

High

~72%

~43K śr. tokenów

Domyślny wybór dla większości agentowego kodowania: jakość zbliżona do Max przy mniej więcej połowie zużycia tokenów.

Max

~74%

~83K śr. tokenów

Trudne problemy długodystansowe — przydziel dodatkowe obliczenia, gdy zadanie naprawdę tego wymaga.

Uśrednione dla Terminal-Bench 2.1, DeepSWE i SWE-Atlas QnA, ewaluowane na Claude Code 2.1.167. Dane raportowane przez autorów modelu. Przy porównywalnych budżetach tokenów GLM-5.2 plasuje się pomiędzy Claude Opus 4.7 a Opus 4.8.

Jak model GLM osiąga kontekst 1M

Podniesienie limitu kontekstu z 200K do 1M tokenów to problem inżynierski, a nie flaga w konfiguracji. Odpowiadają za to trzy zmiany.

IndexShare dla sparse attention

Każde cztery warstwy transformera współdzielą jeden lekki indekser. Znajduje się on w pierwszej z czterech warstw, a jego indeksy top-k są ponownie wykorzystywane przez pozostałe trzy — co eliminuje iloczyn skalarny indeksera i selekcję top-k w 3 na 4 warstwy. Efekt: 2,9× niższa liczba FLOP-ów na token przy długości kontekstu 1M. Trenowane z IndexShare od etapu mid-training przy długości sekwencji 128K.

Współdzielenie warstw w modelu GLM dzięki IndexShareWarstwa N+3Warstwa N+2Warstwa N+1Warstwa NWspółdzielonyIndekser

MTP z IndexShare i KVShare

Warstwa multi-token-prediction uruchamia swój indekser raz, na pierwszym kroku szkicowania, i wykorzystuje te indeksy w kolejnych krokach, eliminując niedopasowanie KV-cache między treningiem a inferencją, które ograniczało poprzednią generację. W połączeniu z rejection sampling i kompleksową stratą TV długość akceptacji rośnie z 4,56 do 5,47 — o około 20% — w 7 krokach MTP.

Ablacja długości akceptacji MTP
Punkt odniesienia4.56
+ IndexShare + KVShare5.10
+ Rejection Sampling5.29
+ kompleksowa strata TV5.47 (+20%)

Wydajne serwowanie kontekstu 1M

Powyżej kilkuset tysięcy tokenów wąskim gardłem przestają być obliczenia, a staje się nim pojemność KV-cache, kernele długokontekstowe i narzut po stronie CPU. Trzy poprawki: drobnoziarniste zarządzanie pamięcią i równoległość oparte na LayerSplit, prace nad kernelami skalującymi się z długością kontekstu skoordynowane z potokiem transferu cache oraz zarządzanie cache po stronie CPU, szeregowanie żądań i strojenie ścieżek runtime. Przewaga w przepustowości rośnie wraz z długością kontekstu.

Znormalizowana przewaga w przepustowości

Trenowany z agentowym RL

Stos treningowy (slime) łączy rollout white-box i black-box, kompaktowe trajektorie oraz przepływy z subagentami. Równoległy trening OPD scalił ponad dziesięć modeli eksperckich w mniej więcej dwa dni, a KV-cache w FP8 utrzymał pamięć rolloutu w ryzach.

Ochrona przed reward hackingiem

Długodystansowy RL zachęca do pójścia na skróty, więc podejrzane działania przechodzą przez regułowy filtr czułości, a następnie przez precyzyjną kontrolę z sędzią LLM. Potwierdzone nadużycia są blokowane online i otrzymują atrapę wyniku narzędzia, dzięki czemu rollout może trwać dalej zamiast zostać odrzucony. PPO oparte na krytyku i pojedynczych rolloutach utrzymuje trenowalność podtrajektorii po kompresji.

Gdzie długodystansowy model GLM naprawdę się opłaca

Wdrożenia na dużą skalę

Funkcje obejmujące wiele plików, które nie mieszczą się w jednym oknie kontekstu: model utrzymuje stan całego repozytorium w polu widzenia, zamiast odczytywać go co kilka tur.

Zautomatyzowane badania

Wielogodzinne pętle eksperymentów, w których agent musi planować, uruchamiać, czytać wyniki i korygować — dokładnie to obciążenie, które mierzą FrontierSWE i PostTrainBench.

Optymalizacja wydajności

Praca nad kernelami i systemami, która wymaga utrzymania w jednej trajektorii pełnego grafu wywołań, wyników profilera i wcześniejszych prób.

Złożone debugowanie

Długie ślady reprodukcji, niestabilne testy i awarie obejmujące wiele usług, w których to właśnie ucięcie kontekstu gubi błąd.

Uruchom to wszystko na własnym sprzęcie — wagi na licencji MIT, transformers · vLLM · SGLang · xLLM · ktransformers. Jak uruchomić model GLM lokalnie →

FAQ o modelu GLM

GLM to rodzina dużych modeli językowych z otwartymi wagami, której obecnym flagowcem jest GLM-5.2. Linia obejmuje GLM-4.5-Air i GLM-4.7, dalej GLM-5, GLM-5-Turbo, GLM-5.1 i teraz GLM-5.2, a także warianty mowy i wizji. Każdy podstawowy model GLM jest udostępniany na licencji MIT z otwarcie opublikowanymi wagami.

Wypróbuj działający model AI za darmo — bez konta

Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.