GLM-ASR — o modelo GLM de reconhecimento de voz

O GLM-ASR é o membro de voz da família de modelos GLM: um modelo dedicado de reconhecimento automático de fala que transforma áudio em texto em tempo real, com uma taxa de erro de carateres publicada de 0.0717. Não é um modelo de linguagem com um front-end de áudio acoplado — é um sistema de reconhecimento construído de raiz para o efeito, e é avaliado pela métrica que realmente importa para transcrição, e não por benchmarks de raciocínio.

Uma taxa de erro de carateres de 0.0717 significa que cerca de sete carateres em cada cem estão errados, contando inserções, eliminações e substituições. Na prática, isso é uma saída confortavelmente legível para notas de reunião, legendas ou comandos de voz, sendo os nomes próprios e o jargão de domínio as fontes habituais do erro residual. Como o resto da família, o GLM-ASR tem licença MIT com pesos publicados abertamente, pelo que o áudio nunca tem de sair da sua infraestrutura.

0.0717
taxa de erro de carateres
publicada para o reconhecimento em tempo real do GLM-ASR
MIT
licença open source
MIT, sem restrições regionais
Real-time
modo de reconhecimento
voz para texto em streaming, não apenas em lote

Playground de IA gratuito — experimente um LLM open source ao vivo

Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.

A resposta aparecerá aqui...

Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.

Como interpretar uma taxa de erro de carateres de 0.0717

A taxa de erro de carateres é a distância de edição entre a transcrição e a referência, dividida pelo comprimento da referência — por isso 0.0717 significa cerca de sete erros por cada cem carateres. É uma medida mais rigorosa e mais independente da língua do que a taxa de erro de palavras, razão pela qual é a métrica padrão para sistemas que têm de lidar com línguas sem fronteiras claras entre palavras. O que o número não diz é onde caem os erros. Os sistemas de reconhecimento são sistematicamente mais fracos em nomes, termos de produto, siglas e sotaques carregados, e mais fortes em fala conversacional comum, pelo que uma transcrição pode situar-se em 0.0717 no total sendo praticamente perfeita no corpo do texto e errada exatamente nos termos que queria pesquisar. Se a precisão no vocabulário do domínio é importante, avalie com o seu próprio áudio e considere enviesar o descodificador para uma lista de termos, em vez de julgar apenas pelo valor de destaque.

Taxa de erro de carateres
0.0717
Licença
MIT open source
Posicionamento
Voz para texto em tempo real
Modalidade
Áudio → texto
Alojamento dos pesos
HuggingFace · ModelScope

O GLM-ASR e a tabela de benchmarks publicada

O GLM-ASR é um modelo de reconhecimento de voz e não aparece na tabela comparativa publicada de LLM de texto. O seu valor publicado é a taxa de erro de carateres de 0.0717 citada acima; não existe para ele nenhuma coluna de benchmarks de LLM, e nenhuma é inventada aqui.

A tabela comparativa de 17 benchmarks deste site abrange modelos de texto — avaliações de raciocínio, programação e agênticas — e um reconhecedor de voz não é comparável em nenhum desses eixos. É por isso que esta página reporta a taxa de erro de carateres e fica por aí. Se precisa do lado de texto da família, a página do modelo emblemático traz a coluna publicada completa e o centro de benchmarks traz as 17 avaliações em 8 modelos.

Ver os 17 benchmarks GLM em detalhe →

O lado de texto da família, para contexto

Comparação no Terminal-Bench 2.1 (Terminus-2), tal como publicada pelos autores do modelo. Apresentada apenas para orientação — estes são modelos de texto, não de voz.

O reconhecimento de voz é normalmente uma etapa de um pipeline: transcrever e depois raciocinar sobre a transcrição. Se é isso que está a construir, o GLM-ASR trata da primeira etapa e um modelo GLM de texto da segunda, e o gráfico acima mostra a diferença publicada entre os dois lançamentos de texto mais recentes no Terminal-Bench 2.1 — 81.0 para o GLM-5.2 contra 63.5 para o GLM-5.1. Ambas as etapas podem correr no seu próprio hardware sob a mesma licença MIT.

Ler a comparação completa GLM vs Claude →

Onde se situa o GLM-ASR na linha de modelos GLM

O GLM-ASR fica inteiramente fora da linhagem de texto — é o ramo de voz da família e não um passo entre o GLM-4.7 e o GLM-5. Combine-o com um modelo GLM de texto quando precisar de transcrição seguida de raciocínio; o nível leve GLM-4.7-Flash é um parceiro natural quando todo o pipeline tem de correr localmente, e o GLM-5.2 quando a etapa de raciocínio é genuinamente difícil.

Mais modelos GLM

Ver tudo

FAQ do GLM-ASR

O que é o modelo GLM-ASR?
O GLM-ASR é o modelo de reconhecimento de voz da família de modelos GLM. Faz transcrição de voz para texto em tempo real com uma taxa de erro de carateres publicada de 0.0717 e, como o resto da família, é disponibilizado sob licença MIT com pesos abertos.
O que significa uma taxa de erro de carateres de 0.0717?
É a distância de edição entre a transcrição produzida e a referência, dividida pelo comprimento da referência — cerca de sete carateres errados em cada cem, contando inserções, eliminações e substituições. Os erros concentram-se em nomes, siglas e jargão de domínio, e não na fala conversacional comum.
O GLM-ASR consegue transcrever em tempo real?
Sim — a transcrição de voz para texto em tempo real é o seu propósito declarado, o que significa que emite texto à medida que o áudio chega, em vez de exigir primeiro um ficheiro completo. É isso que o torna utilizável para legendagem ao vivo e controlo por voz, e não apenas para trabalhos de transcrição offline.
O GLM-ASR é open source?
Sim. É um modelo GLM com licença MIT, com pesos publicados no HuggingFace e no ModelScope e sem restrições regionais, pelo que pode fazer a transcrição inteiramente no seu próprio hardware e manter o áudio dentro da sua rede.
O GLM-ASR aparece na tabela de benchmarks GLM?
Não. A comparação publicada de 17 benchmarks abrange modelos de texto em tarefas de raciocínio, programação e agênticas, nas quais um reconhecedor de voz não pode ser pontuado. A sua métrica publicada é a taxa de erro de carateres; para desempenho em texto, veja a página do GLM-5.2 ou o centro de benchmarks completo.

Experimente um modelo de IA ao vivo, grátis — sem conta

Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.