O GLM-ASR é o membro de voz da família de modelos GLM: um modelo dedicado de reconhecimento automático de fala que transforma áudio em texto em tempo real, com uma taxa de erro de carateres publicada de 0.0717. Não é um modelo de linguagem com um front-end de áudio acoplado — é um sistema de reconhecimento construído de raiz para o efeito, e é avaliado pela métrica que realmente importa para transcrição, e não por benchmarks de raciocínio.
Uma taxa de erro de carateres de 0.0717 significa que cerca de sete carateres em cada cem estão errados, contando inserções, eliminações e substituições. Na prática, isso é uma saída confortavelmente legível para notas de reunião, legendas ou comandos de voz, sendo os nomes próprios e o jargão de domínio as fontes habituais do erro residual. Como o resto da família, o GLM-ASR tem licença MIT com pesos publicados abertamente, pelo que o áudio nunca tem de sair da sua infraestrutura.
Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.
A resposta aparecerá aqui...
Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.
A taxa de erro de carateres é a distância de edição entre a transcrição e a referência, dividida pelo comprimento da referência — por isso 0.0717 significa cerca de sete erros por cada cem carateres. É uma medida mais rigorosa e mais independente da língua do que a taxa de erro de palavras, razão pela qual é a métrica padrão para sistemas que têm de lidar com línguas sem fronteiras claras entre palavras. O que o número não diz é onde caem os erros. Os sistemas de reconhecimento são sistematicamente mais fracos em nomes, termos de produto, siglas e sotaques carregados, e mais fortes em fala conversacional comum, pelo que uma transcrição pode situar-se em 0.0717 no total sendo praticamente perfeita no corpo do texto e errada exatamente nos termos que queria pesquisar. Se a precisão no vocabulário do domínio é importante, avalie com o seu próprio áudio e considere enviesar o descodificador para uma lista de termos, em vez de julgar apenas pelo valor de destaque.
O GLM-ASR é um modelo de reconhecimento de voz e não aparece na tabela comparativa publicada de LLM de texto. O seu valor publicado é a taxa de erro de carateres de 0.0717 citada acima; não existe para ele nenhuma coluna de benchmarks de LLM, e nenhuma é inventada aqui.
A tabela comparativa de 17 benchmarks deste site abrange modelos de texto — avaliações de raciocínio, programação e agênticas — e um reconhecedor de voz não é comparável em nenhum desses eixos. É por isso que esta página reporta a taxa de erro de carateres e fica por aí. Se precisa do lado de texto da família, a página do modelo emblemático traz a coluna publicada completa e o centro de benchmarks traz as 17 avaliações em 8 modelos.
Comparação no Terminal-Bench 2.1 (Terminus-2), tal como publicada pelos autores do modelo. Apresentada apenas para orientação — estes são modelos de texto, não de voz.
O reconhecimento de voz é normalmente uma etapa de um pipeline: transcrever e depois raciocinar sobre a transcrição. Se é isso que está a construir, o GLM-ASR trata da primeira etapa e um modelo GLM de texto da segunda, e o gráfico acima mostra a diferença publicada entre os dois lançamentos de texto mais recentes no Terminal-Bench 2.1 — 81.0 para o GLM-5.2 contra 63.5 para o GLM-5.1. Ambas as etapas podem correr no seu próprio hardware sob a mesma licença MIT.
O GLM-ASR fica inteiramente fora da linhagem de texto — é o ramo de voz da família e não um passo entre o GLM-4.7 e o GLM-5. Combine-o com um modelo GLM de texto quando precisar de transcrição seguida de raciocínio; o nível leve GLM-4.7-Flash é um parceiro natural quando todo o pipeline tem de correr localmente, e o GLM-5.2 quando a etapa de raciocínio é genuinamente difícil.
O nível leve de 30B. Eficiente e rápido o suficiente para inferência local, e reportado como superior a modelos abertos de escala semelhante.
O modelo emblemático com contexto de 1M de tokens. É o estado da arte open source em avaliações de programação e de longo alcance, com níveis de esforço explícitos Non-Thinking, High e Max.
Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.