GLM-ASR es el miembro de voz de la familia de modelos GLM: un modelo dedicado de reconocimiento automático del habla que convierte audio en texto en tiempo real, con una tasa de error por carácter publicada de 0.0717. No es un modelo de lenguaje con un front-end de audio añadido: es un sistema de reconocimiento diseñado para ese fin y se evalúa con la métrica que realmente importa en transcripción, no con benchmarks de razonamiento.
Una tasa de error por carácter de 0.0717 significa que aproximadamente siete de cada cien caracteres son incorrectos, contando inserciones, borrados y sustituciones. En la práctica eso es una salida cómodamente legible para actas de reuniones, subtítulos o comandos de voz, con los nombres propios y la jerga de dominio como fuentes habituales del error restante. Como el resto de la familia, GLM-ASR tiene licencia MIT y pesos publicados abiertamente, así que el audio nunca tiene que salir de tu infraestructura.
Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.
La respuesta aparecerá aquí...
Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.
La tasa de error por carácter es la distancia de edición entre la transcripción y la referencia, dividida por la longitud de la referencia; así que 0.0717 significa unos siete errores por cada cien caracteres. Es una medida más estricta e independiente del idioma que la tasa de error por palabra, y por eso es la métrica estándar en sistemas que deben manejar lenguas sin fronteras de palabra claras. Lo que el número no te dice es dónde caen los errores. Los sistemas de reconocimiento son sistemáticamente más débiles con nombres, términos de producto, siglas y acentos marcados, y más fuertes con habla conversacional corriente, de modo que una transcripción puede quedarse en 0.0717 global siendo prácticamente perfecta en el cuerpo del texto y equivocándose justo en los términos que querías buscar. Si la precisión en el vocabulario de tu dominio importa, evalúa con tu propio audio y plantéate sesgar el decodificador hacia una lista de términos en lugar de juzgar solo por la cifra de titular.
GLM-ASR es un modelo de reconocimiento de voz y no aparece en la tabla comparativa publicada de LLM de texto. Su cifra publicada es la tasa de error por carácter de 0.0717 citada arriba; no existe columna de benchmarks de LLM para él y aquí no se inventa ninguna.
La tabla comparativa de 17 benchmarks de este sitio cubre modelos de texto (evaluaciones de razonamiento, programación y agénticas) y un reconocedor de voz no es comparable en ninguno de esos ejes. Por eso esta página reporta la tasa de error por carácter y se detiene ahí. Si necesitas el lado de texto de la familia, la página del buque insignia tiene la columna publicada completa y el hub de benchmarks recoge las 17 evaluaciones en 8 modelos.
Comparación en Terminal-Bench 2.1 (Terminus-2), según los autores del modelo. Se muestra solo a modo de orientación: son modelos de texto, no de voz.
El reconocimiento de voz suele ser una etapa de una canalización: transcribir y luego razonar sobre la transcripción. Si eso es lo que estás construyendo, GLM-ASR se encarga de la primera etapa y un modelo GLM de texto de la segunda, y el gráfico anterior muestra la diferencia publicada entre los dos lanzamientos de texto más recientes en Terminal-Bench 2.1: 81.0 para GLM-5.2 frente a 63.5 para GLM-5.1. Ambas etapas pueden ejecutarse en tu propio hardware bajo la misma licencia MIT.
GLM-ASR queda por completo fuera del linaje de texto: es la rama de voz de la familia más que un paso entre GLM-4.7 y GLM-5. Combínalo con un modelo GLM de texto cuando necesites transcripción seguida de razonamiento; el nivel ligero GLM-4.7-Flash es un compañero natural cuando toda la canalización debe ejecutarse en local, y GLM-5.2 cuando la etapa de razonamiento es realmente difícil.
El nivel ligero de 30B. Eficiente y lo bastante rápido para inferencia local, y según lo publicado supera a modelos abiertos de escala similar.
El buque insignia con contexto de 1M tokens. Es el estado del arte de código abierto en programación y evaluaciones de largo recorrido, con niveles de esfuerzo explícitos Non-Thinking, High y Max.
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.