GLM-5.1 — długodystansowy model GLM sprzed 5.2

GLM-5.1 to model GLM, który uczynił z pracy długodystansowej poważną propozycję dla otwartych wag. Zaoferował kontekst 200 000 tokenów, wielogodzinne autonomiczne wykonywanie zadań i rezultaty na poziomie inżynierskim w momencie, gdy większość otwartych modeli wciąż oceniano na zadaniach jednoplikowych. To także jedyny poza flagowcem model GLM z pełną opublikowaną kolumną benchmarków, co czyni go punktem odniesienia dla każdego usprawnienia GLM-5.2.

Lektura kolumny GLM-5.1 to najszybszy sposób, by zrozumieć, co naprawdę zmieniła kolejna generacja. Tam, gdzie GLM-5.1 uzyskuje 63,5 w Terminal-Bench 2.1, 58,4 w SWE-bench Pro i 30,5 w FrontierSWE Dominance, GLM-5.2 notuje odpowiednio 81,0, 62,1 i 74,4. Różnica jest nierówna w sposób zamierzony: standardowe kodowanie przesunęło się o kilka punktów, a długodystansowe wykonywanie agentowe o dziesiątki. Wszystkie te liczby są zgodne z publikacją autorów modelu.

200K
tokenów kontekstu
limit, który GLM-5.2 podniósł później do miliona
63.5
Terminal-Bench 2.1
opublikowane dla GLM-5.1 w środowisku Terminus-2
30.5
FrontierSWE Dominance
wobec 74,4 dla GLM-5.2 w tej samej ewaluacji

Darmowy playground AI — wypróbuj otwartoźródłowy LLM na żywo

Bez rejestracji, bez konta, bez kredytów. Wpisz prompt i odbierz strumieniowaną odpowiedź.

Odpowiedź pojawi się tutaj...

Ten playground korzysta z darmowego otwartoźródłowego LLM udostępnianego przez OpenRouter. To nie jest GLM-5.2 i nie używa wag GLM — jest tutaj po to, byś mógł przetestować działający model na żywo podczas lektury opublikowanych danych benchmarkowych GLM poniżej.

Co obejmuje okno kontekstu 200K

Dwieście tysięcy tokenów wystarczy na sporą usługę, jej testy i długą rozmowę o nich — mniej więcej zestaw roboczy skoncentrowanej funkcji, a nie całe monorepo. W praktyce oznacza to, że GLM-5.1 komfortowo obsługuje dobrze zakreśloną pracę agentową i zaczyna wymagać warstwy wyszukiwania, gdy zadanie obejmuje wiele modułów. To także okno, przy którym poprzedni projekt multi-token-prediction natrafił na niedopasowanie KV-cache między treningiem a inferencją, ograniczając długość akceptacji w dekodowaniu spekulatywnym do 4,56; usunięcie tego niedopasowania to jedna z konkretnych rzeczy naprawionych w kolejnej generacji. Jeśli Twoje obciążenie mieści się w 200K tokenów, GLM-5.1 pozostaje sprawnym, w pełni otwartym modelem GLM; jeśli nie, skok do okna 1M jest całym powodem istnienia GLM-5.2.

Okno kontekstu
200 000 tokenów
Licencja
MIT, open source
Poziomy wysiłku
Wprowadzone w GLM-5.2
Terminal-Bench 2.1
63,5 (Terminus-2)
Host wag
HuggingFace · ModelScope

Wyniki benchmarków GLM-5.1

Wyniki zgodnie z publikacją autorów modelu.

Opublikowana kolumna GLM-5.1 wygląda przyzwoicie w rozumowaniu i kodowaniu średniej długości: 95,3 w AIME 2026, 86,2 w GPQA-Diamond, 83,8 w IMOAnswerBench, 71,8 w publicznym zestawie MCP-Atlas i 58,4 w SWE-bench Pro. Wyraźnie brakuje mu zapasu w pracy o ultradługim horyzoncie — 30,5 w FrontierSWE Dominance, 20,1 w PostTrainBench i 1,0 w SWE-Marathon. Te trzy wiersze to dokładnie te obciążenia, pod które trenowano kolejną generację, dlatego różnice są tam znacznie większe niż w standardowych ewaluacjach kodowania.

Zobacz szczegółowo wszystkie 17 benchmarków GLM →

Jak wypada GLM-5.1

Porównanie na Terminal-Bench 2.1 (Terminus-2), zgodnie z publikacją autorów modelu.

W Terminal-Bench 2.1 w środowisku Terminus-2 wynik GLM-5.1 na poziomie 63,5 plasuje się poniżej Qwen3.7-Max z 75,0 i mniej więcej na równi z DeepSeek-V4-Pro z 64,0, podczas gdy GLM-5.2 wybija się w otwartym polu z 81,0, a Claude Opus 4.8 prowadzi z 85,0. Czytany jako historia rodziny wykres pokazuje generację otwartych modeli stłoczoną w okolicach sześćdziesiątki i jedno wydanie, które wyrywa się z tego pasma — to najmocniejszy argument, by traktować GLM-5.2, a nie GLM-5.1, jako obecny punkt odniesienia wśród otwartych wag.

Przeczytaj pełne porównanie GLM-5.2 vs GLM-5.1 →

Gdzie GLM-5.1 plasuje się w rodzinie modeli GLM

GLM-5.1 pojawił się po GLM-5 i GLM-5-Turbo, a zastąpił go GLM-5.2. To ostatni model GLM bez jawnych poziomów wysiłku, więc wszystko, co na nim zbudujesz, przeznacza stałą ilość obliczeń na zadanie, zamiast pozwalać regulować ten kompromis dla każdego żądania. Pozostaje rozsądnym wyborem, gdy chcesz mniejszego, bardziej przewidywalnego śladu pamięciowego niż flagowiec z kontekstem 1M, a Twoje zadania naprawdę mieszczą się w 200K tokenów.

Więcej modeli GLM

Zobacz wszystkie

FAQ o GLM-5.1

Czym jest model GLM-5.1?
GLM-5.1 to poprzedni flagowiec rodziny modeli GLM: model z otwartymi wagami na licencji MIT, z kontekstem 200 000 tokenów, zbudowany do długodystansowego rozumowania i wielogodzinnej autonomicznej pracy inżynierskiej. To jeden z zaledwie dwóch modeli GLM z pełną opublikowaną kolumną benchmarków, obok GLM-5.2.
O ile GLM-5.2 jest lepszy od GLM-5.1?
To całkowicie zależy od ewaluacji. W standardowym kodowaniu różnica jest umiarkowana — SWE-bench Pro przesuwa się z 58,4 do 62,1. W długodystansowej pracy agentowej jest ogromna: FrontierSWE Dominance z 30,5 do 74,4, DeepSWE z 18,0 do 46,2, SWE-Marathon z 1,0 do 13,0. GLM-5.2 wygrywa każdy wiersz opublikowanej tabeli bezpośredniego porównania.
Jak duże jest okno kontekstu GLM-5.1?
200 000 tokenów; GLM-5.2 podniósł później ten limit do solidnego 1 000 000. Dla wielu zadań agentowego kodowania to wystarcza, ale analiza całych repozytoriów i wielogodzinne pętle badawcze to dokładnie te przypadki, w których mniejsze okno zaczyna wymuszać ucinanie kontekstu lub wyszukiwanie.
Czy GLM-5.1 nadal jest open source?
Tak. GLM-5.1 pozostaje modelem GLM z otwartymi wagami na licencji MIT, opublikowanym na HuggingFace i ModelScope. Zastąpienie nowszym wydaniem nie wycofuje poprzedniego — wagi, które już pobrałeś, pozostają użyteczne bezterminowo, co jest jedną z praktycznych przewag otwartych wag nad hostowanym API.
Czy jest jakiś powód, by nadal używać GLM-5.1?
Tak, jeśli Twoje zadania mieszczą się w 200K tokenów i zależy Ci na mniejszym śladzie przy serwowaniu. Okno 200K kosztuje znacznie mniej pamięci KV-cache niż milionowe, a przy dobrze zakreślonej pracy opublikowana różnica w standardowych ewaluacjach kodowania to zaledwie kilka punktów. Do agentów długodystansowych używaj jednak GLM-5.2.

Wypróbuj działający model AI za darmo — bez konta

Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.