GLM-5.2 to flagowy model GLM z otwartymi wagami, zbudowany do realizacji zadań długodystansowych i agentowego kodowania, a nie do jednorazowych rozmów. To wydanie, które podniosło użyteczny kontekst rodziny z 200 000 tokenów do solidnego miliona, wprowadziło jawne poziomy wysiłku i przebudowało stos sparse attention wokół współdzielonego indeksera. Dla zespołu oceniającego otwarte alternatywy dla zamkniętej czołówki to model GLM, który realnie konkuruje w ewaluacjach istotnych dla takich zespołów — i robi to na licencji MIT, z otwarcie opublikowanymi wagami.
W zestawieniu z poprzednikiem GLM-5.1 GLM-5.2 nie jest odświeżeniem przyrostowym. Terminal-Bench 2.1 rośnie z 63,5 do 81,0, DeepSWE z 18,0 do 46,2, a FrontierSWE Dominance z 30,5 do 74,4 — wszystkie liczby zgodnie z publikacją autorów modelu, żadna nie została zmierzona tutaj. Praktyczna konsekwencja jest taka, że agent programistyczny może utrzymać całe repozytorium, wyniki jego testów i własne wcześniejsze próby w jednej trajektorii, zamiast doczytywać fragmenty przez warstwę wyszukiwania.
Bez rejestracji, bez konta, bez kredytów. Wpisz prompt i odbierz strumieniowaną odpowiedź.
Odpowiedź pojawi się tutaj...
Ten playground korzysta z darmowego otwartoźródłowego LLM udostępnianego przez OpenRouter. To nie jest GLM-5.2 i nie używa wag GLM — jest tutaj po to, byś mógł przetestować działający model na żywo podczas lektury opublikowanych danych benchmarkowych GLM poniżej.
Kontekst miliona tokenów zmienia to, co budujesz, a nie tylko to, ile możesz wkleić. Zamiast potoku wyszukiwania podającego modelowi małe, stratne fragmenty, możesz wczytać całe repozytorium, kompletną dokumentację API albo kilka dni logów w jednym promptzie i pozwolić modelowi wnioskować o wszystkim naraz. To właśnie uwidacznia zależności międzyplikowe i awarie systemowe: błąd, który ujawnia się dopiero wtedy, gdy granica usługi, migracja i fixture testowy są widoczne jednocześnie. GLM-5.2 był trenowany na długokontekstowych trajektoriach agentów programistycznych obejmujących wdrożenia na dużą skalę, zautomatyzowane badania, optymalizację wydajności i złożone debugowanie — dlatego autorzy modelu opisują to okno jako solidne, a nie tylko akceptowane: jakość ma się utrzymywać głęboko w kontekście, zamiast spadać, gdy przebieg się komplikuje.
Wyniki zgodnie z publikacją autorów modelu.
Opublikowana kolumna GLM-5.2 jest najmocniejsza dokładnie tam, gdzie model był projektowany: w agentowym kodowaniu i długodystansowym wykonywaniu zadań. Uzyskuje 81,0 w Terminal-Bench 2.1 w środowisku Terminus-2 i 82,7 w Claude Code, 76,8 w publicznym zestawie MCP-Atlas oraz 74,4 w FrontierSWE Dominance, gdzie pojedyncze zadania trwają nawet dwadzieścia godzin. W czystym rozumowaniu raportuje 99,2 w AIME 2026 i 91,2 w GPQA-Diamond. We wszystkich trzech ewaluacjach długodystansowych — FrontierSWE, PostTrainBench i SWE-Marathon — jest najwyżej sklasyfikowanym modelem open source w opublikowanym zestawie porównawczym.
Porównanie na SWE-bench Pro, zgodnie z publikacją autorów modelu.
W SWE-bench Pro wynik GLM-5.2 na poziomie 62,1 ustępuje 69,2 dla Claude Opus 4.8, ale wyprzedza GPT-5.5 z 58,6 i Gemini 3.1 Pro z 54,2 — a także własnego poprzednika GLM-5.1 z 58,4. Ten wzorzec powtarza się w całej tabeli: zamknięta czołówka wciąż prowadzi w kilku standardowych ewaluacjach kodowania, podczas gdy GLM-5.2 jest na szczycie pola modeli z otwartymi wagami i wygrywa pojedyncze wiersze wprost, w tym Terminal-Bench 2.1 w środowisku Claude Code (82,7 wobec 78,9) i AIME 2026 (99,2 wobec 95,7).
GLM-5.2 stoi obecnie na czele linii, która biegnie od GLM-4.5-Air i GLM-4.7 przez GLM-5, GLM-5-Turbo i GLM-5.1. Każdy krok miał inny priorytet — GLM-4.7 skupiał się na programowaniu i generowaniu front-endu, GLM-5-Turbo na długołańcuchowym wykonywaniu agentowym, GLM-5.1 na wielogodzinnej pracy autonomicznej — a GLM-5.2 łączy te zyski w jednym modelu ze znacznie większym oknem. Jeśli budżet sprzętowy wyklucza flagowca, lekkie warstwy GLM-4.7-Flash i GLM-4.5-Air to ta sama rodzina na tej samej licencji MIT.
Poprzedni flagowiec. Przyniósł rodzinie pierwsze duże zyski w pracy długodystansowej i pozostaje punktem odniesienia, względem którego mierzy się każde usprawnienie GLM-5.2.
Model bazowy z serii 5 dostrojony do dynamicznych, długołańcuchowych scenariuszy agentowych, w których plan zmienia się wielokrotnie, a trajektoria musi pozostać wykonalna.
Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.