GLM-5.2 — flagowy model GLM z kontekstem 1M

GLM-5.2 to flagowy model GLM z otwartymi wagami, zbudowany do realizacji zadań długodystansowych i agentowego kodowania, a nie do jednorazowych rozmów. To wydanie, które podniosło użyteczny kontekst rodziny z 200 000 tokenów do solidnego miliona, wprowadziło jawne poziomy wysiłku i przebudowało stos sparse attention wokół współdzielonego indeksera. Dla zespołu oceniającego otwarte alternatywy dla zamkniętej czołówki to model GLM, który realnie konkuruje w ewaluacjach istotnych dla takich zespołów — i robi to na licencji MIT, z otwarcie opublikowanymi wagami.

W zestawieniu z poprzednikiem GLM-5.1 GLM-5.2 nie jest odświeżeniem przyrostowym. Terminal-Bench 2.1 rośnie z 63,5 do 81,0, DeepSWE z 18,0 do 46,2, a FrontierSWE Dominance z 30,5 do 74,4 — wszystkie liczby zgodnie z publikacją autorów modelu, żadna nie została zmierzona tutaj. Praktyczna konsekwencja jest taka, że agent programistyczny może utrzymać całe repozytorium, wyniki jego testów i własne wcześniejsze próby w jednej trajektorii, zamiast doczytywać fragmenty przez warstwę wyszukiwania.

1M
tokenów kontekstu
zwiększony z 200K i wytrenowany tak, by pozostać użytecznym w całym oknie
81.0
Terminal-Bench 2.1
opublikowane dla GLM-5.2, wobec 63,5 dla GLM-5.1
MIT
licencja open source
otwarte wagi, bez ograniczeń regionalnych

Darmowy playground AI — wypróbuj otwartoźródłowy LLM na żywo

Bez rejestracji, bez konta, bez kredytów. Wpisz prompt i odbierz strumieniowaną odpowiedź.

Odpowiedź pojawi się tutaj...

Ten playground korzysta z darmowego otwartoźródłowego LLM udostępnianego przez OpenRouter. To nie jest GLM-5.2 i nie używa wag GLM — jest tutaj po to, byś mógł przetestować działający model na żywo podczas lektury opublikowanych danych benchmarkowych GLM poniżej.

Co naprawdę daje okno kontekstu 1M

Kontekst miliona tokenów zmienia to, co budujesz, a nie tylko to, ile możesz wkleić. Zamiast potoku wyszukiwania podającego modelowi małe, stratne fragmenty, możesz wczytać całe repozytorium, kompletną dokumentację API albo kilka dni logów w jednym promptzie i pozwolić modelowi wnioskować o wszystkim naraz. To właśnie uwidacznia zależności międzyplikowe i awarie systemowe: błąd, który ujawnia się dopiero wtedy, gdy granica usługi, migracja i fixture testowy są widoczne jednocześnie. GLM-5.2 był trenowany na długokontekstowych trajektoriach agentów programistycznych obejmujących wdrożenia na dużą skalę, zautomatyzowane badania, optymalizację wydajności i złożone debugowanie — dlatego autorzy modelu opisują to okno jako solidne, a nie tylko akceptowane: jakość ma się utrzymywać głęboko w kontekście, zamiast spadać, gdy przebieg się komplikuje.

Okno kontekstu
1 000 000 tokenów
Licencja
MIT, open source
Poziomy wysiłku
Non-Thinking · High · Max
Maks. wyjście
128 000 tokenów
Host wag
HuggingFace · ModelScope

Wyniki benchmarków GLM-5.2

Wyniki zgodnie z publikacją autorów modelu.

Opublikowana kolumna GLM-5.2 jest najmocniejsza dokładnie tam, gdzie model był projektowany: w agentowym kodowaniu i długodystansowym wykonywaniu zadań. Uzyskuje 81,0 w Terminal-Bench 2.1 w środowisku Terminus-2 i 82,7 w Claude Code, 76,8 w publicznym zestawie MCP-Atlas oraz 74,4 w FrontierSWE Dominance, gdzie pojedyncze zadania trwają nawet dwadzieścia godzin. W czystym rozumowaniu raportuje 99,2 w AIME 2026 i 91,2 w GPQA-Diamond. We wszystkich trzech ewaluacjach długodystansowych — FrontierSWE, PostTrainBench i SWE-Marathon — jest najwyżej sklasyfikowanym modelem open source w opublikowanym zestawie porównawczym.

Zobacz szczegółowo wszystkie 17 benchmarków GLM →

Jak wypada GLM-5.2

Porównanie na SWE-bench Pro, zgodnie z publikacją autorów modelu.

W SWE-bench Pro wynik GLM-5.2 na poziomie 62,1 ustępuje 69,2 dla Claude Opus 4.8, ale wyprzedza GPT-5.5 z 58,6 i Gemini 3.1 Pro z 54,2 — a także własnego poprzednika GLM-5.1 z 58,4. Ten wzorzec powtarza się w całej tabeli: zamknięta czołówka wciąż prowadzi w kilku standardowych ewaluacjach kodowania, podczas gdy GLM-5.2 jest na szczycie pola modeli z otwartymi wagami i wygrywa pojedyncze wiersze wprost, w tym Terminal-Bench 2.1 w środowisku Claude Code (82,7 wobec 78,9) i AIME 2026 (99,2 wobec 95,7).

Przeczytaj pełne porównanie GLM vs Claude →

Gdzie GLM-5.2 plasuje się w rodzinie modeli GLM

GLM-5.2 stoi obecnie na czele linii, która biegnie od GLM-4.5-Air i GLM-4.7 przez GLM-5, GLM-5-Turbo i GLM-5.1. Każdy krok miał inny priorytet — GLM-4.7 skupiał się na programowaniu i generowaniu front-endu, GLM-5-Turbo na długołańcuchowym wykonywaniu agentowym, GLM-5.1 na wielogodzinnej pracy autonomicznej — a GLM-5.2 łączy te zyski w jednym modelu ze znacznie większym oknem. Jeśli budżet sprzętowy wyklucza flagowca, lekkie warstwy GLM-4.7-Flash i GLM-4.5-Air to ta sama rodzina na tej samej licencji MIT.

Więcej modeli GLM

Zobacz wszystkie

FAQ o GLM-5.2

Czym GLM-5.2 różni się od GLM-5.1?
GLM-5.2 podnosi użyteczny kontekst z 200 000 do solidnego 1 000 000 tokenów i przebudowuje sparse attention wokół IndexShare, co obniża liczbę FLOP-ów na token 2,9× przy długości kontekstu 1M. Opublikowane różnice w benchmarkach są duże: Terminal-Bench 2.1 z 63,5 do 81,0, DeepSWE z 18,0 do 46,2 i FrontierSWE Dominance z 30,5 do 74,4. Wprowadza też poziomy wysiłku Non-Thinking, High i Max.
Czy GLM-5.2 jest open source?
Tak. Podstawowe wagi GLM-5.2 są wydane na licencji MIT bez ograniczeń regionalnych i opublikowane na HuggingFace oraz ModelScope. Możesz je pobrać, dostroić i serwować na własnym sprzęcie bez proszenia o zgodę i bez wypuszczania promptów poza własną infrastrukturę.
Czy mogę uruchomić model GLM-5.2 lokalnie?
Tak. Autorzy modelu wymieniają wsparcie dla transformers, vLLM, SGLang, xLLM i ktransformers. Serwowanie pełnego kontekstu 1M to bardziej problem pamięci niż mocy obliczeniowej — powyżej kilkuset tysięcy tokenów wąskim gardłem staje się pojemność KV-cache — dlatego większość wdrożeń self-hosted pracuje na krótszym oknie z tymi samymi wagami.
Czym są poziomy wysiłku w GLM-5.2?
Non-Thinking, High i Max sterują tym, ile obliczeń model przeznacza na zadanie. Na opublikowanej krzywej agentowego kodowania to mniej więcej 63% przy około 35K tokenów wyjściowych, 72% przy około 43K i 74% przy około 83K. High to praktyczne ustawienie domyślne; Max zwraca koszt tokenów tylko przy naprawdę trudnych problemach długodystansowych.
Jak GLM-5.2 wypada na tle Claude Opus 4.8?
Opus 4.8 prowadzi w większości opublikowanej tabeli, w tym w SWE-bench Pro (69,2 wobec 62,1), NL2Repo i SWE-Marathon. GLM-5.2 wygrywa Terminal-Bench 2.1 w środowisku Claude Code (82,7 wobec 78,9) oraz AIME 2026 i IMOAnswerBench, a w FrontierSWE traci mniej niż punkt. Oferuje też pięciokrotnie większe okno kontekstu i otwarte wagi.

Wypróbuj działający model AI za darmo — bez konta

Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.