GLM-ASR — model GLM do rozpoznawania mowy

GLM-ASR to mowowy członek rodziny modeli GLM: dedykowany model automatycznego rozpoznawania mowy, który zamienia dźwięk na tekst w czasie rzeczywistym, z opublikowanym współczynnikiem błędu znakowego 0,0717. To nie jest model językowy z doklejonym frontendem audio — to celowo zbudowany system rozpoznawania, oceniany metryką, która naprawdę ma znaczenie dla transkrypcji, a nie benchmarkami rozumowania.

Współczynnik błędu znakowego 0,0717 oznacza, że mniej więcej siedem znaków na sto jest błędnych, licząc wstawienia, usunięcia i zamiany. W praktyce to komfortowo czytelny materiał na notatki ze spotkań, napisy czy komendy głosowe, przy czym zwykłym źródłem pozostałych błędów są nazwy własne i żargon branżowy. Jak reszta rodziny GLM-ASR jest na licencji MIT z otwarcie opublikowanymi wagami, więc dźwięk nigdy nie musi opuszczać Twojej infrastruktury.

0.0717
współczynnik błędu znakowego
opublikowany dla rozpoznawania w czasie rzeczywistym GLM-ASR
MIT
licencja open source
MIT, bez ograniczeń regionalnych
Real-time
tryb rozpoznawania
strumieniowa transkrypcja mowy, nie tylko wsadowa

Darmowy playground AI — wypróbuj otwartoźródłowy LLM na żywo

Bez rejestracji, bez konta, bez kredytów. Wpisz prompt i odbierz strumieniowaną odpowiedź.

Odpowiedź pojawi się tutaj...

Ten playground korzysta z darmowego otwartoźródłowego LLM udostępnianego przez OpenRouter. To nie jest GLM-5.2 i nie używa wag GLM — jest tutaj po to, byś mógł przetestować działający model na żywo podczas lektury opublikowanych danych benchmarkowych GLM poniżej.

Jak czytać współczynnik błędu znakowego 0,0717

Współczynnik błędu znakowego to odległość edycyjna między transkrypcją a referencją podzielona przez długość referencji — 0,0717 oznacza więc około siedmiu błędów na sto znaków. Jest to miara surowsza i bardziej niezależna od języka niż współczynnik błędu słownego, dlatego stanowi standard dla systemów obsługujących języki bez wyraźnych granic słów. Liczba ta nie mówi jednak, gdzie te błędy się pojawiają. Systemy rozpoznawania konsekwentnie najsłabiej radzą sobie z nazwami, terminami produktowymi, skrótowcami i silnym akcentem, a najlepiej ze zwykłą mową potoczną — transkrypcja może więc mieć ogólnie 0,0717 i być praktycznie bezbłędna w tekście głównym, a jednocześnie błędna dokładnie w tych terminach, których chciałeś szukać. Jeśli zależy Ci na dokładności w słownictwie branżowym, oceń model na własnym materiale audio i rozważ ukierunkowanie dekodera na listę terminów, zamiast oceniać po samej liczbie nagłówkowej.

Współczynnik błędu znakowego
0,0717
Licencja
MIT, open source
Pozycjonowanie
Transkrypcja mowy w czasie rzeczywistym
Modalność
Audio → tekst
Host wag
HuggingFace · ModelScope

GLM-ASR a opublikowana tabela benchmarków

GLM-ASR to model rozpoznawania mowy i nie występuje w opublikowanej tabeli porównawczej tekstowych LLM. Jego opublikowaną liczbą jest przytoczony wyżej współczynnik błędu znakowego 0,0717; nie istnieje dla niego kolumna benchmarków LLM i żadnej tu nie wymyślamy.

Tabela 17 benchmarków w tym serwisie obejmuje modele tekstowe — ewaluacje rozumowania, kodowania i zadań agentowych — a systemu rozpoznawania mowy nie da się porównać na żadnej z tych osi. Dlatego ta strona podaje współczynnik błędu znakowego i na tym poprzestaje. Jeśli potrzebujesz tekstowej strony rodziny, strona flagowca zawiera pełną opublikowaną kolumnę, a centrum benchmarków — wszystkie 17 ewaluacji dla 8 modeli.

Zobacz szczegółowo wszystkie 17 benchmarków GLM →

Tekstowa strona rodziny, dla kontekstu

Porównanie na Terminal-Bench 2.1 (Terminus-2), zgodnie z publikacją autorów modelu. Pokazane wyłącznie orientacyjnie — to modele tekstowe, nie mowowe.

Rozpoznawanie mowy to zwykle jeden etap potoku: najpierw transkrypcja, potem wnioskowanie na jej podstawie. Jeśli właśnie to budujesz, GLM-ASR obsłuży pierwszy etap, a tekstowy model GLM drugi; powyższy wykres pokazuje opublikowaną różnicę między dwoma najnowszymi wydaniami tekstowymi w Terminal-Bench 2.1 — 81,0 dla GLM-5.2 wobec 63,5 dla GLM-5.1. Oba etapy mogą działać na Twoim sprzęcie na tej samej licencji MIT.

Przeczytaj pełne porównanie GLM vs Claude →

Gdzie GLM-ASR plasuje się w rodzinie modeli GLM

GLM-ASR stoi całkowicie poza linią tekstową — to mowowa gałąź rodziny, a nie krok między GLM-4.7 a GLM-5. Połącz go z tekstowym modelem GLM, gdy potrzebujesz transkrypcji, a po niej wnioskowania; lekka warstwa GLM-4.7-Flash to naturalny partner, gdy cały potok ma działać lokalnie, a GLM-5.2 — gdy etap rozumowania jest naprawdę trudny.

Więcej modeli GLM

Zobacz wszystkie

FAQ o GLM-ASR

Czym jest model GLM-ASR?
GLM-ASR to model rozpoznawania mowy z rodziny modeli GLM. Wykonuje transkrypcję mowy na tekst w czasie rzeczywistym z opublikowanym współczynnikiem błędu znakowego 0,0717 i, jak reszta rodziny, jest wydany na licencji MIT z otwartymi wagami.
Co oznacza współczynnik błędu znakowego 0,0717?
To odległość edycyjna między wygenerowaną transkrypcją a referencją podzielona przez długość referencji — mniej więcej siedem błędnych znaków na sto, licząc wstawienia, usunięcia i zamiany. Błędy skupiają się na nazwach, skrótowcach i żargonie branżowym, a nie na zwykłej mowie potocznej.
Czy GLM-ASR potrafi transkrybować w czasie rzeczywistym?
Tak — transkrypcja mowy w czasie rzeczywistym to jego deklarowane przeznaczenie, co oznacza, że generuje tekst w miarę napływania dźwięku, zamiast wymagać kompletnego pliku. Właśnie to czyni go użytecznym do napisów na żywo i sterowania głosem, a nie tylko do transkrypcji offline.
Czy GLM-ASR jest open source?
Tak. To model GLM na licencji MIT z wagami opublikowanymi na HuggingFace i ModelScope, bez ograniczeń regionalnych, więc transkrypcję możesz prowadzić w całości na własnym sprzęcie i zatrzymać dźwięk we własnej sieci.
Czy GLM-ASR występuje w tabeli benchmarków GLM?
Nie. Opublikowane porównanie 17 benchmarków obejmuje modele tekstowe w zadaniach rozumowania, kodowania i agentowych, w których systemu rozpoznawania mowy nie da się ocenić. Jego opublikowaną metryką jest współczynnik błędu znakowego; po wyniki tekstowe zajrzyj na stronę GLM-5.2 lub do pełnego centrum benchmarków.

Wypróbuj działający model AI za darmo — bez konta

Przeczytaj benchmarki modeli GLM, a potem sprawdź działający model w praktyce. Playground powyżej jest darmowy i niczego od Ciebie nie wymaga; jeśli chcesz pełniejszego zestawu narzędzi AI, darmowy plan naszego partnera zaczyna się tutaj.