GLM-ASR to mowowy członek rodziny modeli GLM: dedykowany model automatycznego rozpoznawania mowy, który zamienia dźwięk na tekst w czasie rzeczywistym, z opublikowanym współczynnikiem błędu znakowego 0,0717. To nie jest model językowy z doklejonym frontendem audio — to celowo zbudowany system rozpoznawania, oceniany metryką, która naprawdę ma znaczenie dla transkrypcji, a nie benchmarkami rozumowania.
Współczynnik błędu znakowego 0,0717 oznacza, że mniej więcej siedem znaków na sto jest błędnych, licząc wstawienia, usunięcia i zamiany. W praktyce to komfortowo czytelny materiał na notatki ze spotkań, napisy czy komendy głosowe, przy czym zwykłym źródłem pozostałych błędów są nazwy własne i żargon branżowy. Jak reszta rodziny GLM-ASR jest na licencji MIT z otwarcie opublikowanymi wagami, więc dźwięk nigdy nie musi opuszczać Twojej infrastruktury.
Bez rejestracji, bez konta, bez kredytów. Wpisz prompt i odbierz strumieniowaną odpowiedź.
Odpowiedź pojawi się tutaj...
Ten playground korzysta z darmowego otwartoźródłowego LLM udostępnianego przez OpenRouter. To nie jest GLM-5.2 i nie używa wag GLM — jest tutaj po to, byś mógł przetestować działający model na żywo podczas lektury opublikowanych danych benchmarkowych GLM poniżej.
Współczynnik błędu znakowego to odległość edycyjna między transkrypcją a referencją podzielona przez długość referencji — 0,0717 oznacza więc około siedmiu błędów na sto znaków. Jest to miara surowsza i bardziej niezależna od języka niż współczynnik błędu słownego, dlatego stanowi standard dla systemów obsługujących języki bez wyraźnych granic słów. Liczba ta nie mówi jednak, gdzie te błędy się pojawiają. Systemy rozpoznawania konsekwentnie najsłabiej radzą sobie z nazwami, terminami produktowymi, skrótowcami i silnym akcentem, a najlepiej ze zwykłą mową potoczną — transkrypcja może więc mieć ogólnie 0,0717 i być praktycznie bezbłędna w tekście głównym, a jednocześnie błędna dokładnie w tych terminach, których chciałeś szukać. Jeśli zależy Ci na dokładności w słownictwie branżowym, oceń model na własnym materiale audio i rozważ ukierunkowanie dekodera na listę terminów, zamiast oceniać po samej liczbie nagłówkowej.
GLM-ASR to model rozpoznawania mowy i nie występuje w opublikowanej tabeli porównawczej tekstowych LLM. Jego opublikowaną liczbą jest przytoczony wyżej współczynnik błędu znakowego 0,0717; nie istnieje dla niego kolumna benchmarków LLM i żadnej tu nie wymyślamy.
Tabela 17 benchmarków w tym serwisie obejmuje modele tekstowe — ewaluacje rozumowania, kodowania i zadań agentowych — a systemu rozpoznawania mowy nie da się porównać na żadnej z tych osi. Dlatego ta strona podaje współczynnik błędu znakowego i na tym poprzestaje. Jeśli potrzebujesz tekstowej strony rodziny, strona flagowca zawiera pełną opublikowaną kolumnę, a centrum benchmarków — wszystkie 17 ewaluacji dla 8 modeli.
Porównanie na Terminal-Bench 2.1 (Terminus-2), zgodnie z publikacją autorów modelu. Pokazane wyłącznie orientacyjnie — to modele tekstowe, nie mowowe.
Rozpoznawanie mowy to zwykle jeden etap potoku: najpierw transkrypcja, potem wnioskowanie na jej podstawie. Jeśli właśnie to budujesz, GLM-ASR obsłuży pierwszy etap, a tekstowy model GLM drugi; powyższy wykres pokazuje opublikowaną różnicę między dwoma najnowszymi wydaniami tekstowymi w Terminal-Bench 2.1 — 81,0 dla GLM-5.2 wobec 63,5 dla GLM-5.1. Oba etapy mogą działać na Twoim sprzęcie na tej samej licencji MIT.
GLM-ASR stoi całkowicie poza linią tekstową — to mowowa gałąź rodziny, a nie krok między GLM-4.7 a GLM-5. Połącz go z tekstowym modelem GLM, gdy potrzebujesz transkrypcji, a po niej wnioskowania; lekka warstwa GLM-4.7-Flash to naturalny partner, gdy cały potok ma działać lokalnie, a GLM-5.2 — gdy etap rozumowania jest naprawdę trudny.
Lekka warstwa 30B. Wydajna i wystarczająco szybka do lokalnej inferencji; raportowana jako wyprzedzająca otwarte modele podobnej skali.
Flagowiec z kontekstem 1M tokenów. To otwartoźródłowy stan sztuki w ewaluacjach kodowania i pracy długodystansowej, z jawnymi poziomami wysiłku Non-Thinking, High i Max.
Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.