GLM-ASR — El modelo GLM de reconocimiento de voz

GLM-ASR es el miembro de voz de la familia de modelos GLM: un modelo dedicado de reconocimiento automático del habla que convierte audio en texto en tiempo real, con una tasa de error por carácter publicada de 0.0717. No es un modelo de lenguaje con un front-end de audio añadido: es un sistema de reconocimiento diseñado para ese fin y se evalúa con la métrica que realmente importa en transcripción, no con benchmarks de razonamiento.

Una tasa de error por carácter de 0.0717 significa que aproximadamente siete de cada cien caracteres son incorrectos, contando inserciones, borrados y sustituciones. En la práctica eso es una salida cómodamente legible para actas de reuniones, subtítulos o comandos de voz, con los nombres propios y la jerga de dominio como fuentes habituales del error restante. Como el resto de la familia, GLM-ASR tiene licencia MIT y pesos publicados abiertamente, así que el audio nunca tiene que salir de tu infraestructura.

0.0717
tasa de error por carácter
publicada para el reconocimiento en tiempo real de GLM-ASR
MIT
licencia de código abierto
MIT, sin restricciones regionales
Real-time
modo de reconocimiento
voz a texto en streaming, no solo por lotes

Playground de IA gratuito — prueba un LLM de código abierto en vivo

Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.

La respuesta aparecerá aquí...

Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.

Cómo interpretar una tasa de error por carácter de 0.0717

La tasa de error por carácter es la distancia de edición entre la transcripción y la referencia, dividida por la longitud de la referencia; así que 0.0717 significa unos siete errores por cada cien caracteres. Es una medida más estricta e independiente del idioma que la tasa de error por palabra, y por eso es la métrica estándar en sistemas que deben manejar lenguas sin fronteras de palabra claras. Lo que el número no te dice es dónde caen los errores. Los sistemas de reconocimiento son sistemáticamente más débiles con nombres, términos de producto, siglas y acentos marcados, y más fuertes con habla conversacional corriente, de modo que una transcripción puede quedarse en 0.0717 global siendo prácticamente perfecta en el cuerpo del texto y equivocándose justo en los términos que querías buscar. Si la precisión en el vocabulario de tu dominio importa, evalúa con tu propio audio y plantéate sesgar el decodificador hacia una lista de términos en lugar de juzgar solo por la cifra de titular.

Tasa de error por carácter
0.0717
Licencia
Código abierto MIT
Posicionamiento
Voz a texto en tiempo real
Modalidad
Audio → texto
Alojamiento de pesos
HuggingFace · ModelScope

GLM-ASR y la tabla de benchmarks publicada

GLM-ASR es un modelo de reconocimiento de voz y no aparece en la tabla comparativa publicada de LLM de texto. Su cifra publicada es la tasa de error por carácter de 0.0717 citada arriba; no existe columna de benchmarks de LLM para él y aquí no se inventa ninguna.

La tabla comparativa de 17 benchmarks de este sitio cubre modelos de texto (evaluaciones de razonamiento, programación y agénticas) y un reconocedor de voz no es comparable en ninguno de esos ejes. Por eso esta página reporta la tasa de error por carácter y se detiene ahí. Si necesitas el lado de texto de la familia, la página del buque insignia tiene la columna publicada completa y el hub de benchmarks recoge las 17 evaluaciones en 8 modelos.

Ver los 17 benchmarks de GLM en detalle →

El lado de texto de la familia, a modo de contexto

Comparación en Terminal-Bench 2.1 (Terminus-2), según los autores del modelo. Se muestra solo a modo de orientación: son modelos de texto, no de voz.

El reconocimiento de voz suele ser una etapa de una canalización: transcribir y luego razonar sobre la transcripción. Si eso es lo que estás construyendo, GLM-ASR se encarga de la primera etapa y un modelo GLM de texto de la segunda, y el gráfico anterior muestra la diferencia publicada entre los dos lanzamientos de texto más recientes en Terminal-Bench 2.1: 81.0 para GLM-5.2 frente a 63.5 para GLM-5.1. Ambas etapas pueden ejecutarse en tu propio hardware bajo la misma licencia MIT.

Leer la comparativa completa GLM vs Claude →

Dónde encaja GLM-ASR en la gama de modelos GLM

GLM-ASR queda por completo fuera del linaje de texto: es la rama de voz de la familia más que un paso entre GLM-4.7 y GLM-5. Combínalo con un modelo GLM de texto cuando necesites transcripción seguida de razonamiento; el nivel ligero GLM-4.7-Flash es un compañero natural cuando toda la canalización debe ejecutarse en local, y GLM-5.2 cuando la etapa de razonamiento es realmente difícil.

Más modelos GLM

Ver todo

Preguntas frecuentes sobre GLM-ASR

¿Qué es el modelo GLM-ASR?
GLM-ASR es el modelo de reconocimiento de voz de la familia de modelos GLM. Realiza transcripción de voz a texto en tiempo real con una tasa de error por carácter publicada de 0.0717 y, como el resto de la familia, se publica con licencia MIT y pesos abiertos.
¿Qué significa una tasa de error por carácter de 0.0717?
Es la distancia de edición entre la transcripción producida y la referencia dividida por la longitud de la referencia: aproximadamente siete caracteres erróneos por cada cien, contando inserciones, borrados y sustituciones. Los errores se concentran en nombres, siglas y jerga de dominio más que en el habla conversacional corriente.
¿Puede GLM-ASR transcribir en tiempo real?
Sí: la voz a texto en tiempo real es su objetivo de diseño declarado, lo que significa que emite texto a medida que entra el audio en lugar de requerir primero un archivo completo. Eso es lo que lo hace utilizable para subtitulado en directo y control por voz, y no solo para trabajos de transcripción offline.
¿Es GLM-ASR de código abierto?
Sí. Es un modelo GLM con licencia MIT y pesos publicados en HuggingFace y ModelScope, sin restricciones regionales, así que puedes ejecutar la transcripción íntegramente en tu propio hardware y mantener el audio dentro de tu red.
¿Aparece GLM-ASR en la tabla de benchmarks de GLM?
No. La comparativa publicada de 17 benchmarks cubre modelos de texto en tareas de razonamiento, programación y agénticas, en las que un reconocedor de voz no puede puntuarse. Su métrica publicada es la tasa de error por carácter; para el rendimiento en texto, consulta la página de GLM-5.2 o el hub de benchmarks completo.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.