GLM-ASR est le membre vocal de la famille de modèles GLM : un modèle de reconnaissance automatique de la parole dédié, qui transforme l'audio en texte en temps réel avec un taux d'erreur par caractère publié de 0.0717. Ce n'est pas un modèle de langage auquel on aurait greffé une entrée audio — c'est un système de reconnaissance conçu pour cela, et il est évalué sur la métrique qui compte réellement pour la transcription plutôt que sur des benchmarks de raisonnement.
Un taux d'erreur par caractère de 0.0717 signifie qu'environ sept caractères sur cent sont erronés, insertions, suppressions et substitutions comprises. En pratique, cela donne une sortie tout à fait lisible pour des comptes rendus de réunion, des sous-titres ou des commandes vocales, les noms propres et le jargon métier restant les sources habituelles de l'erreur résiduelle. Comme le reste de la famille, GLM-ASR est sous licence MIT avec des poids publiés ouvertement : l'audio n'a donc jamais besoin de quitter votre infrastructure.
Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.
La réponse s'affichera ici en streaming...
Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.
Le taux d'erreur par caractère est la distance d'édition entre la transcription et la référence, divisée par la longueur de la référence — 0.0717 signifie donc environ sept erreurs pour cent caractères. C'est une mesure plus stricte et plus indépendante de la langue que le taux d'erreur par mot, d'où son statut de métrique standard pour les systèmes qui doivent traiter des langues sans frontières de mots nettes. Ce que le chiffre ne dit pas, c'est où tombent les erreurs. Les systèmes de reconnaissance sont systématiquement les plus faibles sur les noms, les termes produits, les acronymes et les accents marqués, et les plus forts sur la parole conversationnelle ordinaire : une transcription peut donc afficher 0.0717 globalement tout en étant quasi parfaite sur le corps du texte et fausse précisément sur les termes que vous vouliez rechercher. Si la précision sur le vocabulaire métier compte, évaluez sur votre propre audio et envisagez de biaiser le décodeur vers une liste de termes plutôt que de vous fier au seul chiffre affiché.
GLM-ASR est un modèle de reconnaissance vocale et n'apparaît pas dans le tableau comparatif publié des LLM texte. Son chiffre publié est le taux d'erreur par caractère de 0.0717 cité plus haut ; aucune colonne de benchmark LLM n'existe pour lui, et aucune n'est inventée ici.
Le tableau comparatif de 17 benchmarks de ce site couvre des modèles de texte — évaluations de raisonnement, de programmation et agentiques — et un système de reconnaissance vocale n'est comparable sur aucun de ces axes. C'est pourquoi cette page rapporte le taux d'erreur par caractère et s'en tient là. Si vous avez besoin du versant texte de la famille, la page du vaisseau amiral porte la colonne publiée complète et le hub des benchmarks rassemble les 17 évaluations sur 8 modèles.
Comparaison sur Terminal-Bench 2.1 (Terminus-2), telle que publiée par les auteurs du modèle. Fournie à titre indicatif — il s'agit de modèles de texte, pas de modèles vocaux.
La reconnaissance vocale n'est généralement qu'une étape d'un pipeline : transcrire, puis raisonner sur la transcription. Si c'est ce que vous construisez, GLM-ASR gère la première étape et un modèle GLM texte la seconde, et le graphique ci-dessus montre l'écart publié entre les deux dernières versions texte sur Terminal-Bench 2.1 — 81.0 pour GLM-5.2 contre 63.5 pour GLM-5.1. Les deux étapes peuvent tourner sur votre propre matériel sous la même licence MIT.
GLM-ASR se situe entièrement hors de la lignée texte — c'est la branche vocale de la famille plutôt qu'une étape entre GLM-4.7 et GLM-5. Associez-le à un modèle GLM texte quand vous avez besoin de transcription puis de raisonnement ; le palier léger GLM-4.7-Flash est un partenaire naturel quand tout le pipeline doit tourner en local, et GLM-5.2 lorsque l'étape de raisonnement est vraiment difficile.
Le palier léger à 30B. Assez efficace et rapide pour l'inférence locale, et annoncé comme devançant les modèles ouverts d'échelle comparable.
Le vaisseau amiral à contexte d'1M de tokens. Il représente l'état de l'art open source sur les évaluations de programmation et de longue haleine, avec des niveaux d'effort explicites Non-Thinking, High et Max.
Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.