GLM-5.2 to flagowy model GLM z otwartymi wagami: solidny kontekst 1M tokenów, poziomy wysiłku Non-Thinking / High / Max oraz raportowane wyniki 81,0 w Terminal-Bench 2.1 i 74,4 w FrontierSWE. Porównaj poniżej wszystkie modele GLM — albo najpierw wypróbuj darmowy playground AI.
Bez rejestracji, bez konta, bez kredytów. Wpisz prompt i odbierz strumieniowaną odpowiedź.
Odpowiedź pojawi się tutaj...
Ten playground korzysta z darmowego otwartoźródłowego LLM udostępnianego przez OpenRouter. To nie jest GLM-5.2 i nie używa wag GLM — jest tutaj po to, byś mógł przetestować działający model na żywo podczas lektury opublikowanych danych benchmarkowych GLM poniżej.
Cztery zdolności definiują obecną generację modeli GLM — wszystkie raportowane przez autorów modelu i odtwarzalne z otwartych wag.
Kontekst 1M tokenów, który pozostaje użyteczny, a nie tylko akceptowany: GLM-5.2 był trenowany na długokontekstowych trajektoriach agentów programistycznych obejmujących wdrożenia na dużą skalę, zautomatyzowane badania i złożone debugowanie.
Non-Thinking, High i Max pozwalają wymieniać opóźnienie na możliwości w zależności od zadania — od około 63% przy ~35K tokenów wyjściowych do 74% przy ~83K w ewaluacjach agentowego kodowania.
Jeden lekki indekser współdzielony przez każde cztery warstwy sparse attention obniża liczbę FLOP-ów na token 2,9× przy długości kontekstu 1M, bez utraty jakości na dużych dystansach.
Otwartoźródłowy model GLM na licencji MIT: wagi na HuggingFace i ModelScope, bez ograniczeń regionalnych, z lokalnym serwowaniem przez transformers, vLLM, SGLang, xLLM i ktransformers.
Wszystkie poniższe liczby to wyniki opublikowane przez autorów modelu dla GLM-5.2 i jego zestawu porównawczego. glmmodel.com je raportuje; nie przeprowadza tych ewaluacji.
Dominacja, zadania trwające do 20 godzin
Do 10 godzin na pojedynczym H100
Ultradługi horyzont SWE, do 10 godzin
We wszystkich trzech benchmarkach długodystansowych GLM-5.2 jest najwyżej sklasyfikowanym modelem open source — dowód, że jego kontekst 1M przekłada się na wykonaną pracę, a nie tylko na zaakceptowane tokeny. Ustępuje Opus 4.8 o jeden punkt w FrontierSWE, wyprzedza GPT-5.5 o jeden i wyprzedza poprzednią generację Opus 4.7 o jedenaście.
Opublikowane wyniki benchmarków modeli GLM — 17 ewaluacji dla 8 modeli.
| Benchmark | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Rozumowanie | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE w/ Tools | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Kodowanie | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (best harness) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agentowe | ||||||||
| MCP-Atlas (public set) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* wynik na pełnym zestawie.
Model GLM nie ma jednej prędkości. Kontrola poziomu wysiłku pozwala przeznaczyć więcej obliczeń wyłącznie na zadania, które tego wymagają.
~35K śr. tokenów
Szybkie edycje, kod szablonowy, rutynowe refaktoryzacje — wszędzie tam, gdzie opóźnienie liczy się bardziej niż głębia.
~43K śr. tokenów
Domyślny wybór dla większości agentowego kodowania: jakość zbliżona do Max przy mniej więcej połowie zużycia tokenów.
~83K śr. tokenów
Trudne problemy długodystansowe — przydziel dodatkowe obliczenia, gdy zadanie naprawdę tego wymaga.
Uśrednione dla Terminal-Bench 2.1, DeepSWE i SWE-Atlas QnA, ewaluowane na Claude Code 2.1.167. Dane raportowane przez autorów modelu. Przy porównywalnych budżetach tokenów GLM-5.2 plasuje się pomiędzy Claude Opus 4.7 a Opus 4.8.
Podniesienie limitu kontekstu z 200K do 1M tokenów to problem inżynierski, a nie flaga w konfiguracji. Odpowiadają za to trzy zmiany.
Każde cztery warstwy transformera współdzielą jeden lekki indekser. Znajduje się on w pierwszej z czterech warstw, a jego indeksy top-k są ponownie wykorzystywane przez pozostałe trzy — co eliminuje iloczyn skalarny indeksera i selekcję top-k w 3 na 4 warstwy. Efekt: 2,9× niższa liczba FLOP-ów na token przy długości kontekstu 1M. Trenowane z IndexShare od etapu mid-training przy długości sekwencji 128K.
Warstwa multi-token-prediction uruchamia swój indekser raz, na pierwszym kroku szkicowania, i wykorzystuje te indeksy w kolejnych krokach, eliminując niedopasowanie KV-cache między treningiem a inferencją, które ograniczało poprzednią generację. W połączeniu z rejection sampling i kompleksową stratą TV długość akceptacji rośnie z 4,56 do 5,47 — o około 20% — w 7 krokach MTP.
| Punkt odniesienia | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Rejection Sampling | 5.29 |
| + kompleksowa strata TV | 5.47 (+20%) |
Powyżej kilkuset tysięcy tokenów wąskim gardłem przestają być obliczenia, a staje się nim pojemność KV-cache, kernele długokontekstowe i narzut po stronie CPU. Trzy poprawki: drobnoziarniste zarządzanie pamięcią i równoległość oparte na LayerSplit, prace nad kernelami skalującymi się z długością kontekstu skoordynowane z potokiem transferu cache oraz zarządzanie cache po stronie CPU, szeregowanie żądań i strojenie ścieżek runtime. Przewaga w przepustowości rośnie wraz z długością kontekstu.
Znormalizowana przewaga w przepustowości
Stos treningowy (slime) łączy rollout white-box i black-box, kompaktowe trajektorie oraz przepływy z subagentami. Równoległy trening OPD scalił ponad dziesięć modeli eksperckich w mniej więcej dwa dni, a KV-cache w FP8 utrzymał pamięć rolloutu w ryzach.
Długodystansowy RL zachęca do pójścia na skróty, więc podejrzane działania przechodzą przez regułowy filtr czułości, a następnie przez precyzyjną kontrolę z sędzią LLM. Potwierdzone nadużycia są blokowane online i otrzymują atrapę wyniku narzędzia, dzięki czemu rollout może trwać dalej zamiast zostać odrzucony. PPO oparte na krytyku i pojedynczych rolloutach utrzymuje trenowalność podtrajektorii po kompresji.
Od warstwy 30B Flash po flagowiec z kontekstem 1M — wybierz model GLM i zobacz jego pełną specyfikację oraz kolumnę benchmarków.
Kontekst 1M tokenów, otwartoźródłowy SOTA w kodowaniu i zadaniach długodystansowych, mocniejsza inżynieria agentowa.
Poprzedni flagowiec: duże zyski w pracy długodystansowej i wielogodzinna praca autonomiczna na poziomie inżynierskim.
Mocniejsze kodowanie, bardziej niezawodne wykonywanie wielokrokowe i lepsze zachowanie w złożonych scenariuszach agentowych.
Model bazowy dostrojony do długołańcuchowych, dynamicznych scenariuszy agentowych.
Ulepszone programowanie, stabilne rozumowanie wielokrokowe i lepsze generowanie front-endu.
30 mld parametrów; wydajny i szybki, wyprzedza otwarte modele podobnej skali.
Model GLM o małym śladzie pamięciowym, z mocną wydajnością na jednostkę mocy obliczeniowej.
Rozpoznawanie mowy na tekst w czasie rzeczywistym przy CER 0,0717.
Funkcje obejmujące wiele plików, które nie mieszczą się w jednym oknie kontekstu: model utrzymuje stan całego repozytorium w polu widzenia, zamiast odczytywać go co kilka tur.
Wielogodzinne pętle eksperymentów, w których agent musi planować, uruchamiać, czytać wyniki i korygować — dokładnie to obciążenie, które mierzą FrontierSWE i PostTrainBench.
Praca nad kernelami i systemami, która wymaga utrzymania w jednej trajektorii pełnego grafu wywołań, wyników profilera i wcześniejszych prób.
Długie ślady reprodukcji, niestabilne testy i awarie obejmujące wiele usług, w których to właśnie ucięcie kontekstu gubi błąd.
Uruchom to wszystko na własnym sprzęcie — wagi na licencji MIT, transformers · vLLM · SGLang · xLLM · ktransformers. Jak uruchomić model GLM lokalnie →
Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.