To kompletny zestaw opublikowanych benchmarków GLM w jednym miejscu: 17 ewaluacji dla 8 modeli, obejmujących rozumowanie, kodowanie i agentowe korzystanie z narzędzi, plus trzy ewaluacje długodystansowe przeprowadzone przez podmioty trzecie. Wszystko na tej stronie to wynik opublikowany przez autorów modelu lub przez organizację, która przeprowadziła ewaluację. glmmodel.com raportuje te liczby; nie przeprowadza tych testów.
To rozróżnienie nie jest zastrzeżeniem dla samego zastrzeżenia. Wyniki benchmarków zależą od środowiska testowego w stopniu, który zaskakuje — ten sam model w tej samej ewaluacji przesuwa się o kilka punktów między Terminus-2 a Claude Code — więc sekcja metodologii na dole tej strony jest prawdopodobnie bardziej użyteczna niż sama tabela. Czytaj te liczby jako raportowaną zdolność w podanych warunkach, a nie jako obietnicę dotyczącą Twojego obciążenia.
Wszystkie liczby na tej stronie to wyniki opublikowane przez autorów modelu. glmmodel.com je raportuje; nie przeprowadza tych ewaluacji.
Dominacja, zadania trwające do 20 godzin
Najlepszy model open sourceDo 10 godzin na pojedynczym H100
2. miejsce ogółemUltradługi horyzont SWE, do 10 godzin
2. miejsce za serią OpusTrio długodystansowe to dokładnie to, pod co budowano obecną generację modeli GLM, a wszystkie trzy ewaluacje przeprowadziły organizacje zewnętrzne, a nie autorzy modelu. FrontierSWE mierzy dominację w zadaniach trwających nawet dwadzieścia godzin; PostTrainBench trwa do dziesięciu godzin na pojedynczym H100; SWE-Marathon to inżynieria oprogramowania o ultradługim horyzoncie, również do dziesięciu godzin. GLM-5.2 jest najwyżej sklasyfikowanym modelem open source we wszystkich trzech. Ustępuje Claude Opus 4.8 o siedem dziesiątych punktu w FrontierSWE, wyprzedza tam GPT-5.5 o 1,8 i wyprzedza poprzednią generację Opus 4.7 o ponad jedenaście.
Porównanie GLM-5.2 z GLM-5.1 izoluje efekt jednej generacji pracy, a zestawienie obu z najlepszym modelem zamkniętym w każdym wierszu pokazuje, ile dystansu pozostało. Plakietki różnic poniżej to opublikowany wynik GLM-5.2 minus opublikowany wynik GLM-5.1. Zwróć uwagę, jak są nierówne: 3,7 punktu w SWE-bench Pro wobec 28,2 punktu w DeepSWE. Ewaluacje nagradzające długotrwałe wykonywanie zadań przesunęły się o wiele bardziej niż te nagradzające jedną dobrą poprawkę.
Poniższa pełna tabela jest wersją wiążącą, pogrupowaną w sekcje rozumowania, kodowania i zadań agentowych. Kolumna GLM-5.2 jest wyróżniona. Myślnik oznacza, że autorzy modelu nie opublikowali wyniku dla danego modelu w danym benchmarku, a ten serwis nie wypełnia takich komórek szacunkami. Przewiń w poziomie, by zobaczyć wszystkie kolumny modeli.
| Benchmark | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Rozumowanie | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE w/ Tools | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Kodowanie | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (best harness) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agentowe | ||||||||
| MCP-Atlas (public set) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* wynik na pełnym zestawie.
Opublikowane wyniki benchmarków modeli GLM — 17 ewaluacji dla 8 modeli.
Poniższe ustawienia ewaluacji to te opublikowane wraz z wynikami. Warto je przeczytać przed zacytowaniem jakiejkolwiek liczby, bo długość kontekstu, parametry próbkowania, wersja środowiska testowego i limit czasu istotnie przesuwają wyniki — a także dlatego, że kilka z tych ewaluacji przeprowadziły podmioty trzecie, a nie autorzy modelu.
Próbkowanie przy temperaturze 1,0 i top-p 0,95, z maksymalną długością generacji 163 840 tokenów. Domyślnie raportowany jest podzbiór tekstowy; wyniki oznaczone gwiazdką pochodzą z pełnego zestawu. AIME, HMMT i IMOAnswerBench korzystają ze stałego promptu systemowego określającego format odpowiedzi, z GPT-5.5 (medium) jako modelem sędziowskim. HLE z narzędziami używa kontekstu 300 000 tokenów i nie stosuje strategii zarządzania kontekstem.
Uruchomione w OpenHands z dostosowanym promptem instrukcyjnym, przy temperaturze 1, top-p 1 i limicie 32K nowych tokenów, w oknie kontekstu 400K.
Ewaluacja przy temperaturze 1,0, top-p 1,0 i limicie 48K nowych tokenów w kontekście 400K. Stosowana jest ocena regułowa i oparta na LLM, blokująca złośliwe zachowania, takie jak nieautoryzowana instalacja pakietów czy wywołania sieciowe.
Uruchomione z oficjalnym frameworkiem ewaluacyjnym i środowiskiem mini-swe-agent przy temperaturze 1,0, top-p 1,0 i dwugodzinnym limicie czasu w kontekście 400K. Każde zadanie działa w izolowanym kontenerze z 2 CPU, 8 GB RAM i bez dostępu do internetu.
200 instancji ocenionych w Claude Code 2.1.156 przy temperaturze 1,0, top-p 1,0, limicie 64 000 tokenów, do 2000 tur, sześciogodzinnym limicie czasu na próbkę i maksymalnym poziomie wysiłku, w kontekście 400K. Każda instancja działa w piaskownicy z 4 CPU i 8 GB, z wyłączonym dostępem do internetu.
Ewaluacja we frameworku Terminus-2 z parsowaniem JSON, czterogodzinnym limitem czasu, temperaturą 1,0, top-p 1,0, limitem 48K nowych tokenów i maksymalnie 500 epizodami, w oknie kontekstu 256K. Zasoby ograniczono do 4 CPU i 8 GB RAM.
Ewaluacja w Claude Code 2.1.167 przy temperaturze 1,0, top-p 0,95 i 131 072 nowych tokenach, z limitem wyjścia CLI 64K obejściem przez przezroczyste proxy. Limity czasu rzeczywistego zniesiono, zachowując ograniczenia CPU i pamięci per zadanie. Wyniki uśredniono z pięciu przebiegów.
Wszystkie modele ocenione w trybie myślenia na publicznym podzbiorze 500 zadań, z dziesięciominutowym limitem czasu na zadanie, z Gemini-3.0-Pro jako modelem sędziowskim.
Uruchomione przez oficjalny serwis ewaluacyjny z maksymalnym budżetem tokenów ustawionym na 128K.
Przeprowadzone przez Proximal, a nie przez autorów modelu, z długością kontekstu 1M, maksymalnym poziomem wysiłku i limitem 128K tokenów wyjściowych. Wynik dominacji podano na dzień 16 czerwca 2026.
Przeprowadzone przez PostTrainBench, a nie przez autorów modelu, z długością kontekstu 1M, maksymalnym poziomem wysiłku i limitem 128K tokenów wyjściowych.
Przeprowadzone przez Abundant AI, a nie przez autorów modelu, z długością kontekstu 1M, maksymalnym poziomem wysiłku i limitem 128K tokenów wyjściowych.
Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.