GLM-ASR — le modèle GLM de reconnaissance vocale

GLM-ASR est le membre vocal de la famille de modèles GLM : un modèle de reconnaissance automatique de la parole dédié, qui transforme l'audio en texte en temps réel avec un taux d'erreur par caractère publié de 0.0717. Ce n'est pas un modèle de langage auquel on aurait greffé une entrée audio — c'est un système de reconnaissance conçu pour cela, et il est évalué sur la métrique qui compte réellement pour la transcription plutôt que sur des benchmarks de raisonnement.

Un taux d'erreur par caractère de 0.0717 signifie qu'environ sept caractères sur cent sont erronés, insertions, suppressions et substitutions comprises. En pratique, cela donne une sortie tout à fait lisible pour des comptes rendus de réunion, des sous-titres ou des commandes vocales, les noms propres et le jargon métier restant les sources habituelles de l'erreur résiduelle. Comme le reste de la famille, GLM-ASR est sous licence MIT avec des poids publiés ouvertement : l'audio n'a donc jamais besoin de quitter votre infrastructure.

0.0717
taux d'erreur par caractère
publié pour la reconnaissance en temps réel de GLM-ASR
MIT
licence open source
MIT, sans restriction régionale
Real-time
mode de reconnaissance
transcription en flux continu, pas uniquement par lots

Playground IA gratuit — testez un LLM open source en direct

Sans inscription, sans compte, sans crédits. Saisissez un prompt et recevez une réponse en streaming.

La réponse s'affichera ici en streaming...

Ce playground fait tourner un LLM open source gratuit via OpenRouter. Ce n'est pas GLM-5.2 et il n'utilise pas les poids GLM — il est là pour vous laisser tester un modèle en direct pendant que vous consultez les données de benchmark GLM publiées ci-dessous.

Comment lire un taux d'erreur par caractère de 0.0717

Le taux d'erreur par caractère est la distance d'édition entre la transcription et la référence, divisée par la longueur de la référence — 0.0717 signifie donc environ sept erreurs pour cent caractères. C'est une mesure plus stricte et plus indépendante de la langue que le taux d'erreur par mot, d'où son statut de métrique standard pour les systèmes qui doivent traiter des langues sans frontières de mots nettes. Ce que le chiffre ne dit pas, c'est où tombent les erreurs. Les systèmes de reconnaissance sont systématiquement les plus faibles sur les noms, les termes produits, les acronymes et les accents marqués, et les plus forts sur la parole conversationnelle ordinaire : une transcription peut donc afficher 0.0717 globalement tout en étant quasi parfaite sur le corps du texte et fausse précisément sur les termes que vous vouliez rechercher. Si la précision sur le vocabulaire métier compte, évaluez sur votre propre audio et envisagez de biaiser le décodeur vers une liste de termes plutôt que de vous fier au seul chiffre affiché.

Taux d'erreur par caractère
0.0717
Licence
Open source MIT
Positionnement
Transcription vocale en temps réel
Modalité
Audio → texte
Hébergement des poids
HuggingFace · ModelScope

GLM-ASR et le tableau de benchmarks publié

GLM-ASR est un modèle de reconnaissance vocale et n'apparaît pas dans le tableau comparatif publié des LLM texte. Son chiffre publié est le taux d'erreur par caractère de 0.0717 cité plus haut ; aucune colonne de benchmark LLM n'existe pour lui, et aucune n'est inventée ici.

Le tableau comparatif de 17 benchmarks de ce site couvre des modèles de texte — évaluations de raisonnement, de programmation et agentiques — et un système de reconnaissance vocale n'est comparable sur aucun de ces axes. C'est pourquoi cette page rapporte le taux d'erreur par caractère et s'en tient là. Si vous avez besoin du versant texte de la famille, la page du vaisseau amiral porte la colonne publiée complète et le hub des benchmarks rassemble les 17 évaluations sur 8 modèles.

Voir en détail les 17 benchmarks GLM →

Le versant texte de la famille, pour situer

Comparaison sur Terminal-Bench 2.1 (Terminus-2), telle que publiée par les auteurs du modèle. Fournie à titre indicatif — il s'agit de modèles de texte, pas de modèles vocaux.

La reconnaissance vocale n'est généralement qu'une étape d'un pipeline : transcrire, puis raisonner sur la transcription. Si c'est ce que vous construisez, GLM-ASR gère la première étape et un modèle GLM texte la seconde, et le graphique ci-dessus montre l'écart publié entre les deux dernières versions texte sur Terminal-Bench 2.1 — 81.0 pour GLM-5.2 contre 63.5 pour GLM-5.1. Les deux étapes peuvent tourner sur votre propre matériel sous la même licence MIT.

Lire la comparaison complète GLM vs Claude →

La place de GLM-ASR dans la gamme des modèles GLM

GLM-ASR se situe entièrement hors de la lignée texte — c'est la branche vocale de la famille plutôt qu'une étape entre GLM-4.7 et GLM-5. Associez-le à un modèle GLM texte quand vous avez besoin de transcription puis de raisonnement ; le palier léger GLM-4.7-Flash est un partenaire naturel quand tout le pipeline doit tourner en local, et GLM-5.2 lorsque l'étape de raisonnement est vraiment difficile.

Autres modèles GLM

Tout voir

FAQ GLM-ASR

Qu'est-ce que le modèle GLM-ASR ?
GLM-ASR est le modèle de reconnaissance vocale de la famille de modèles GLM. Il assure la transcription de la parole en temps réel avec un taux d'erreur par caractère publié de 0.0717 et, comme le reste de la famille, il est publié sous licence MIT avec des poids ouverts.
Que signifie un taux d'erreur par caractère de 0.0717 ?
C'est la distance d'édition entre la transcription produite et la référence, divisée par la longueur de la référence — soit environ sept caractères faux pour cent, insertions, suppressions et substitutions comprises. Les erreurs se concentrent sur les noms, les acronymes et le jargon métier plutôt que sur la parole conversationnelle ordinaire.
GLM-ASR peut-il transcrire en temps réel ?
Oui — la transcription en temps réel est son objectif de conception annoncé, ce qui signifie qu'il produit du texte au fil du flux audio au lieu d'exiger d'abord un fichier complet. C'est ce qui le rend utilisable pour le sous-titrage en direct et la commande vocale, et pas seulement pour des travaux de transcription hors ligne.
GLM-ASR est-il open source ?
Oui. C'est un modèle GLM sous licence MIT avec des poids publiés sur HuggingFace et ModelScope et sans restriction régionale : vous pouvez donc exécuter la transcription entièrement sur votre propre matériel et garder l'audio à l'intérieur de votre réseau.
GLM-ASR figure-t-il dans le tableau de benchmarks GLM ?
Non. La comparaison publiée sur 17 benchmarks couvre des modèles de texte sur des tâches de raisonnement, de programmation et agentiques, sur lesquelles un système de reconnaissance vocale ne peut pas être noté. Sa métrique publiée est le taux d'erreur par caractère ; pour les performances texte, voyez la page GLM-5.2 ou le hub complet des benchmarks.

Testez un modèle d'IA en direct, gratuitement et sans compte

Consultez les benchmarks des modèles GLM, puis mettez un vrai modèle au travail. Le playground ci-dessus est gratuit et ne demande rien ; si vous cherchez une boîte à outils IA plus complète, l'offre gratuite de notre partenaire commence ici.