Les hallucinations ASR peuvent ajouter à la transcription des mots jamais prononcés. Un nouvel article, Grounded in Sound, teste si un retour acoustique pendant l’entraînement réduit ces insertions. Ses résultats sur l’audio de réunions justifient de mesurer les insertions séparément du WER global.
Qu’est-ce qui a changé dans les résultats ?
Les auteurs rapportent des réductions relatives d’insertions de 28,3 % sur AMI-IHM, avec microphone proche, et de 22,3 % sur AMI-SDM, à distance. Sur AMI-SDM, le WER passe de 35,89 % à 34,71 %. Les cinq autres conditions ne montrent aucune différence statistiquement détectable par rapport à la référence entraînée uniquement sur le WER avec un calendrier équivalent.
Ces pourcentages mesurent des choses différentes. Une baisse de 22,3 % des insertions n’est pas une baisse de 22,3 % de toutes les erreurs. Le gain de WER à distance est de 1,18 point. Une évaluation limitée au WER total manquerait une grande partie du changement de composition des erreurs.
Le périmètre est précis. Les expériences utilisent une politique Qwen2-Audio-7B adaptée par LoRA et un juge wav2vec2-CTC figé de 0,3 milliard de paramètres. Les auteurs démontrent un mécanisme dans cette configuration. Les résultats ne prouvent pas des gains équivalents sur d’autres modèles, langues ou appels de production.
Comment fonctionne le juge acoustique ?
Pendant l’entraînement, la politique échantillonne des groupes de huit transcriptions candidates. Un modèle CTC figé, préentraîné séparément, les note face à l’audio. La récompense combine ce score acoustique à un terme fondé sur le WER. Les sorties du juge par trame sont réutilisées entre candidats pour chaque énoncé.
La section méthode place le juge supplémentaire dans l’entraînement. À l’inférence, la politique effectue un seul décodage glouton sans ce score externe. L’article ne rapporte pas de comparaison de latence complète avec des modèles de production.
La récompense a aussi des limites. Sa normalisation dépend de la longueur du candidat et le juge devient moins fiable lorsque l’acoustique se dégrade fortement. L’article observe plus de suppressions avec moins d’insertions. Les deux importent dans une application : omettre un article demandé et en inventer un ont des conséquences différentes.
Le reclassement à l’inférence reproduit-il le résultat ?
Les auteurs ont testé un reclassement CTC des 32 meilleures hypothèses de la politique de référence. Cette configuration n’a pas retrouvé les gains d’insertion de la politique entraînée avec retour acoustique. Cela renseigne sur cette configuration, sans exclure toutes les méthodes possibles.
Les auteurs modifient les poids par post-entraînement par renforcement. L’article n’évalue pas des changements de configuration d’API hébergées. Ses expériences de confiance sans juge proposent une autre piste. Pour la production, nous recommandons de tester l’abstention fondée sur la confiance sur un audio représentatif et de rapporter le compromis de couverture.
Que doit mesurer une équipe d’agents vocaux ?
Une évaluation pratique conserve audio et transcription de référence, puis rapporte insertions, suppressions et substitutions avec le WER. Regroupez les résultats par condition d’enregistrement. Incluez les chevauchements, bruits et distances de microphone réellement rencontrés.
Nous examinerions aussi les cas où la transcription change une action. Une quantité inventée, une négation supprimée ou un nom modifié peuvent compter davantage que plusieurs variations de formulation inoffensives. C’est une recommandation d’évaluation, pas un résultat mesuré dans l’article.
Le timing des tours constitue un sujet distinct. Ink 2 expose notamment turn.start, turn.eager_end et turn.end pour coordonner écoute et réponse. Ces événements ne prouvent pas l’exactitude factuelle d’une transcription. L’article n’évalue pas Ink 2 et ne montre pas que les réglages de fin de parole reproduisent les résultats de sa récompense acoustique.
Quelles sont les limites des preuves ?
Lisez le protocole et les limites avant d’adopter la méthode. L’entraînement utilise LibriSpeech avec ajout de bruit et l’évaluation couvre six conditions, dont les réunions AMI. Les 33 282 instances énoncé-condition ne sont pas toutes des enregistrements indépendants : les énoncés LibriSpeech reviennent sous différents bruits et les deux conditions AMI viennent des mêmes réunions.
AMI est exclu de l’entraînement par renforcement, mais a informé une décision diagnostique sur les conditions acoustiques à inclure. Affirmer qu’il n’a joué aucun rôle avant l’évaluation finale exagérerait la séparation.
Le résultat utile est une baisse des insertions dans un protocole défini. Pour évaluer la reconnaissance vocale, la leçon immédiate est d’examiner quelles erreurs changent. Un WER global inférieur ne dit pas à lui seul si le modèle invente moins de mots.