Benchmarki GLM: wszystkie 17 wyników ewaluacji GLM-5.2

To kompletny zestaw opublikowanych benchmarków GLM w jednym miejscu: 17 ewaluacji dla 8 modeli, obejmujących rozumowanie, kodowanie i agentowe korzystanie z narzędzi, plus trzy ewaluacje długodystansowe przeprowadzone przez podmioty trzecie. Wszystko na tej stronie to wynik opublikowany przez autorów modelu lub przez organizację, która przeprowadziła ewaluację. glmmodel.com raportuje te liczby; nie przeprowadza tych testów.

To rozróżnienie nie jest zastrzeżeniem dla samego zastrzeżenia. Wyniki benchmarków zależą od środowiska testowego w stopniu, który zaskakuje — ten sam model w tej samej ewaluacji przesuwa się o kilka punktów między Terminus-2 a Claude Code — więc sekcja metodologii na dole tej strony jest prawdopodobnie bardziej użyteczna niż sama tabela. Czytaj te liczby jako raportowaną zdolność w podanych warunkach, a nie jako obietnicę dotyczącą Twojego obciążenia.

Trzy długodystansowe benchmarki GLM

Wszystkie liczby na tej stronie to wyniki opublikowane przez autorów modelu. glmmodel.com je raportuje; nie przeprowadza tych ewaluacji.

74.4%
FrontierSWE

Dominacja, zadania trwające do 20 godzin

Najlepszy model open source
34.3%
PostTrainBench

Do 10 godzin na pojedynczym H100

2. miejsce ogółem
13.0%
SWE-Marathon

Ultradługi horyzont SWE, do 10 godzin

2. miejsce za serią Opus

Trio długodystansowe to dokładnie to, pod co budowano obecną generację modeli GLM, a wszystkie trzy ewaluacje przeprowadziły organizacje zewnętrzne, a nie autorzy modelu. FrontierSWE mierzy dominację w zadaniach trwających nawet dwadzieścia godzin; PostTrainBench trwa do dziesięciu godzin na pojedynczym H100; SWE-Marathon to inżynieria oprogramowania o ultradługim horyzoncie, również do dziesięciu godzin. GLM-5.2 jest najwyżej sklasyfikowanym modelem open source we wszystkich trzech. Ustępuje Claude Opus 4.8 o siedem dziesiątych punktu w FrontierSWE, wyprzedza tam GPT-5.5 o 1,8 i wyprzedza poprzednią generację Opus 4.7 o ponad jedenaście.

Zyski w benchmarkach GLM z generacji na generację

Porównanie GLM-5.2 z GLM-5.1 izoluje efekt jednej generacji pracy, a zestawienie obu z najlepszym modelem zamkniętym w każdym wierszu pokazuje, ile dystansu pozostało. Plakietki różnic poniżej to opublikowany wynik GLM-5.2 minus opublikowany wynik GLM-5.1. Zwróć uwagę, jak są nierówne: 3,7 punktu w SWE-bench Pro wobec 28,2 punktu w DeepSWE. Ewaluacje nagradzające długotrwałe wykonywanie zadań przesunęły się o wiele bardziej niż te nagradzające jedną dobrą poprawkę.

Terminal-Bench 2.1+17.5
SWE-bench Pro+3.7
NL2Repo+6.2
DeepSWE+28.2 (2.6×)
ProgramBench+12.8
MCP-Atlas+5.0
Tool-Decathlon+7.5
HLE+9.5

Wszystkie 17 benchmarków GLM dla 8 modeli

Poniższa pełna tabela jest wersją wiążącą, pogrupowaną w sekcje rozumowania, kodowania i zadań agentowych. Kolumna GLM-5.2 jest wyróżniona. Myślnik oznacza, że autorzy modelu nie opublikowali wyniku dla danego modelu w danym benchmarku, a ten serwis nie wypełnia takich komórek szacunkami. Przewiń w poziomie, by zobaczyć wszystkie kolumny modeli.

Opublikowane wyniki benchmarków modeli GLM dla każdej ewaluacji i każdego modelu
BenchmarkGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Rozumowanie
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Kodowanie
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agentowe
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* wynik na pełnym zestawie.

Opublikowane wyniki benchmarków modeli GLM — 17 ewaluacji dla 8 modeli.

Jak przeprowadzono te benchmarki GLM

Poniższe ustawienia ewaluacji to te opublikowane wraz z wynikami. Warto je przeczytać przed zacytowaniem jakiejkolwiek liczby, bo długość kontekstu, parametry próbkowania, wersja środowiska testowego i limit czasu istotnie przesuwają wyniki — a także dlatego, że kilka z tych ewaluacji przeprowadziły podmioty trzecie, a nie autorzy modelu.

HLE i inne zadania rozumowania

Próbkowanie przy temperaturze 1,0 i top-p 0,95, z maksymalną długością generacji 163 840 tokenów. Domyślnie raportowany jest podzbiór tekstowy; wyniki oznaczone gwiazdką pochodzą z pełnego zestawu. AIME, HMMT i IMOAnswerBench korzystają ze stałego promptu systemowego określającego format odpowiedzi, z GPT-5.5 (medium) jako modelem sędziowskim. HLE z narzędziami używa kontekstu 300 000 tokenów i nie stosuje strategii zarządzania kontekstem.

SWE-bench Pro

Uruchomione w OpenHands z dostosowanym promptem instrukcyjnym, przy temperaturze 1, top-p 1 i limicie 32K nowych tokenów, w oknie kontekstu 400K.

NL2Repo

Ewaluacja przy temperaturze 1,0, top-p 1,0 i limicie 48K nowych tokenów w kontekście 400K. Stosowana jest ocena regułowa i oparta na LLM, blokująca złośliwe zachowania, takie jak nieautoryzowana instalacja pakietów czy wywołania sieciowe.

DeepSWE

Uruchomione z oficjalnym frameworkiem ewaluacyjnym i środowiskiem mini-swe-agent przy temperaturze 1,0, top-p 1,0 i dwugodzinnym limicie czasu w kontekście 400K. Każde zadanie działa w izolowanym kontenerze z 2 CPU, 8 GB RAM i bez dostępu do internetu.

ProgramBench

200 instancji ocenionych w Claude Code 2.1.156 przy temperaturze 1,0, top-p 1,0, limicie 64 000 tokenów, do 2000 tur, sześciogodzinnym limicie czasu na próbkę i maksymalnym poziomie wysiłku, w kontekście 400K. Każda instancja działa w piaskownicy z 4 CPU i 8 GB, z wyłączonym dostępem do internetu.

Terminal-Bench 2.1 (Terminus-2)

Ewaluacja we frameworku Terminus-2 z parsowaniem JSON, czterogodzinnym limitem czasu, temperaturą 1,0, top-p 1,0, limitem 48K nowych tokenów i maksymalnie 500 epizodami, w oknie kontekstu 256K. Zasoby ograniczono do 4 CPU i 8 GB RAM.

Terminal-Bench 2.1 (Claude Code)

Ewaluacja w Claude Code 2.1.167 przy temperaturze 1,0, top-p 0,95 i 131 072 nowych tokenach, z limitem wyjścia CLI 64K obejściem przez przezroczyste proxy. Limity czasu rzeczywistego zniesiono, zachowując ograniczenia CPU i pamięci per zadanie. Wyniki uśredniono z pięciu przebiegów.

MCP-Atlas

Wszystkie modele ocenione w trybie myślenia na publicznym podzbiorze 500 zadań, z dziesięciominutowym limitem czasu na zadanie, z Gemini-3.0-Pro jako modelem sędziowskim.

Tool-Decathlon

Uruchomione przez oficjalny serwis ewaluacyjny z maksymalnym budżetem tokenów ustawionym na 128K.

FrontierSWE

Przeprowadzone przez Proximal, a nie przez autorów modelu, z długością kontekstu 1M, maksymalnym poziomem wysiłku i limitem 128K tokenów wyjściowych. Wynik dominacji podano na dzień 16 czerwca 2026.

PostTrainBench

Przeprowadzone przez PostTrainBench, a nie przez autorów modelu, z długością kontekstu 1M, maksymalnym poziomem wysiłku i limitem 128K tokenów wyjściowych.

SWE-Marathon

Przeprowadzone przez Abundant AI, a nie przez autorów modelu, z długością kontekstu 1M, maksymalnym poziomem wysiłku i limitem 128K tokenów wyjściowych.

FAQ o benchmarkach GLM

Jakie są wyniki benchmarków GLM-5.2?
Opublikowane wyniki nagłówkowe to 81,0 w Terminal-Bench 2.1, 62,1 w SWE-bench Pro, 74,4 w FrontierSWE Dominance, 34,3 w PostTrainBench, 46,2 w DeepSWE, 76,8 w publicznym zestawie MCP-Atlas i 99,2 w AIME 2026. To najwyżej sklasyfikowany model open source we wszystkich trzech ewaluacjach długodystansowych.
Kto przeprowadził te benchmarki GLM?
Większość przeprowadzili autorzy modelu i opublikowali ustawienia. Trzy ewaluacje długodystansowe wykonały podmioty trzecie: FrontierSWE — Proximal, PostTrainBench — PostTrainBench, a SWE-Marathon — Abundant AI. glmmodel.com nie przeprowadził żadnej z nich i raportuje wszystkie w opublikowanej postaci.
Dlaczego Terminal-Bench 2.1 ma dwa różne wyniki?
Bo środowisko testowe zmienia rezultat. W Terminus-2 GLM-5.2 uzyskuje 81,0, a Claude Opus 4.8 85,0; w Claude Code GLM-5.2 uzyskuje 82,7, a Opus 4.8 78,9. Ten sam benchmark, przeciwny zwycięzca — dlatego środowisko testowe zawsze należy podawać razem z liczbą.
Dlaczego niektóre komórki tabeli są puste?
Myślnik oznacza, że dla danego modelu w danym benchmarku nie opublikowano wyniku. Ten serwis nie szacuje, nie interpoluje ani nie wnioskuje brakujących komórek, bo zmyślona liczba w tabeli porównawczej jest gorsza niż uczciwa luka.
Czy mogę odtworzyć te wyniki benchmarków GLM?
Potencjalnie tak, jeśli odtworzysz opublikowane ustawienia — długość kontekstu, parametry próbkowania, wersja środowiska testowego, limity czasu i zasobów są wymienione w sekcji metodologii powyżej. I tak spodziewaj się rozrzutu; kilka z tych ewaluacji uśrednia wiele przebiegów właśnie dlatego, że pojedyncze przebiegi są zaszumione.

Wypróbuj działający model AI za darmo — bez konta

Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.