GLM-5.2 vs GLM-5.1 to jedyne porównanie w tym serwisie bez cienia niejasności: we wszystkich 19 opublikowanych ewaluacjach, w których oba modele mają wynik, nowszy model GLM wygrywa każdy wiersz. Ciekawe jest nie to, kto wygrywa, lecz o ile — bo przewagi wahają się od czterech dziesiątych punktu do ponad czterdziestu.
Ten rozrzut to najlepszy dostępny dowód na to, co ta generacja naprawdę zmieniła. Standardowe rozumowanie przesunęło się nieznacznie, standardowe kodowanie umiarkowanie, a długodystansowe wykonywanie agentowe ogromnie — czyli dokładnie tak, jak można się spodziewać po wydaniu, którego sztandarowymi zmianami są pięciokrotny wzrost kontekstu i przebudowany stos sparse attention. Wszystkie liczby zgodnie z publikacją autorów modelu.
GLM-5.2 wygrywa 19 z 19 opublikowanych wierszy przeciwko GLM-5.1. Niewielkie przewagi dotyczą benchmarków już bliskich sufitu — HMMT listopad 2025 przesuwa się z 94,0 do 94,4, a HLE z narzędziami z 52,3 do 54,7. Duże dotyczą pracy długodystansowej: FrontierSWE Dominance z 30,5 do 74,4, SWE-Marathon z 1,0 do 13,0, DeepSWE z 18,0 do 46,2 i CritPt z 4,6 do 20,9. Terminal-Bench 2.1 rośnie z 63,5 do 81,0 w Terminus-2 i z 69,0 do 82,7 w Claude Code. Jeśli pracujesz dziś na GLM-5.1, a Twoje obciążenie jest agentowe, to nie jest marginalna aktualizacja.
Zmiany strukturalne tłumaczą rozrzut w benchmarkach. Limit kontekstu wzrósł z 200 000 do 1 000 000 tokenów, sparse attention przebudowano tak, by każde cztery warstwy współdzieliły jeden lekki indekser, usunięto niedopasowanie KV-cache między treningiem a inferencją w warstwie multi-token-prediction i wprowadzono jawne poziomy wysiłku. Oba wydania pozostają modelami GLM z otwartymi wagami na licencji MIT, na tych samych publicznych hostach.
| Cecha | GLM-5.2 | GLM-5.1 |
|---|---|---|
| Okno kontekstu | 1 000 000 tokenów | 200 000 tokenów |
| Architektura uwagi | Sparse attention z IndexShare | Sparse attention, indekser w każdej warstwie |
| Długość akceptacji MTP | 5,47 (+20%) | 4,56 (punkt odniesienia) |
| Kontrola wysiłku | Jawna — Non-Thinking, High, Max | Niedostępne |
| Licencja | Licencja MIT | Licencja MIT |
Przeczytaj najpierw blok kodowania: dziewięć wierszy, dziewięć zwycięstw, a przyrosty rosną wraz z długością zadania. SWE-bench Pro zyskuje 3,7 punktu, ProgramBench 12,8, Terminal-Bench 2.1 17,5, DeepSWE 28,2 — poprawa 2,6× — a FrontierSWE Dominance 43,9. Blok rozumowania to spokojniejsze, ale równie pełne zwycięstwo: HLE zyskuje 9,5, AIME 2026 3,9, IMOAnswerBench 7,2, GPQA-Diamond 5,0, a CritPt skacze z 4,6 do 20,9, ponad czterokrotnie względem poprzedniego wyniku. Kolejność tych różnic jest całym uzasadnieniem tego wydania. Gdyby generację po prostu trenowano dłużej na większej ilości danych, należałoby oczekiwać mniej więcej jednolitych zysków w całej tabeli; zamiast tego przyrosty podążają za długością zadań w każdej ewaluacji, czyli dokładnie tak, jak przewidywałby pięciokrotny wzrost kontekstu i przebudowa uwagi wycelowana wprost w pracę długodystansową.
| Benchmark | GLM-5.2 | GLM-5.1 | Zwycięzca |
|---|---|---|---|
| Kodowanie i praca długodystansowa | |||
| FrontierSWE Dominance | 74.4 | 30.5 | GLM-5.2 |
| PostTrainBench | 34.3 | 20.1 | GLM-5.2 |
| SWE-Marathon | 13.0 | 1.0 | GLM-5.2 |
| SWE-bench Pro | 62.1 | 58.4 | GLM-5.2 |
| NL2Repo | 48.9 | 42.7 | GLM-5.2 |
| ProgramBench | 63.7 | 50.9 | GLM-5.2 |
| DeepSWE | 46.2 | 18.0 | GLM-5.2 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | GLM-5.2 |
| Terminal-Bench 2.1 (Claude Code) | 82.7 | 69.0 | GLM-5.2 |
| Rozumowanie i zadania agentowe | |||
| MCP-Atlas (public set) | 76.8 | 71.8 | GLM-5.2 |
| Tool-Decathlon | 48.2 | 40.7 | GLM-5.2 |
| HLE | 40.5 | 31.0 | GLM-5.2 |
| HLE w/ Tools | 54.7 | 52.3 | GLM-5.2 |
| CritPt | 20.9 | 4.6 | GLM-5.2 |
| AIME 2026 | 99.2 | 95.3 | GLM-5.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | GLM-5.2 |
| HMMT Feb. 2026 | 92.5 | 82.6 | GLM-5.2 |
| IMOAnswerBench | 91.0 | 83.8 | GLM-5.2 |
| GPQA-Diamond | 91.2 | 86.2 | GLM-5.2 |
* wynik na pełnym zestawie.
Wszystkie liczby na tej stronie to wyniki opublikowane przez autorów modelu. glmmodel.com je raportuje; nie przeprowadza tych ewaluacji.
Zobacz szczegółowo wszystkie 17 benchmarków GLM →Dla każdego nowego wdrożenia GLM-5.2 jest wyborem domyślnym. Wygrywa każdy opublikowany wiersz, ma pięciokrotnie większy kontekst, udostępnia poziomy wysiłku pozwalające świadomie wydawać moc obliczeniową i serwuje to większe okno przy 2,9× niższej liczbie FLOP-ów na token dzięki IndexShare — większy model nie jest więc proporcjonalnie droższy w przeliczeniu na token.
Istnieje dokładnie jeden uczciwy argument za pozostaniem przy GLM-5.1 i jest on operacyjny, a nie jakościowy. Okno 200 000 tokenów kosztuje przy serwowaniu znacznie mniej pamięci KV-cache niż milionowe, więc jeśli Twoje zadania naprawdę się w nim mieszczą, a sprzęt jest ograniczony, starszy model ma mniejszy ślad. W ograniczonej pracy programistycznej opublikowana różnica to zaledwie kilka punktów.
Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.