Las alucinaciones de ASR pueden introducir palabras en una transcripción que el hablante nunca dijo. Un nuevo artículo, Grounded in Sound, prueba si la retroalimentación acústica durante el entrenamiento reduce esos errores de inserción. Sus resultados con audio de reuniones justifican medir las inserciones por separado de la tasa general de error de palabras.
¿Qué cambió en los resultados de alucinaciones de ASR?
Los autores informan de reducciones relativas de inserciones del 28,3 % en habla de reuniones AMI-IHM con micrófono cercano y del 22,3 % en AMI-SDM de campo lejano. En AMI-SDM, la tasa de error de palabras bajó del 35,89 % al 34,71 %. Los otros cinco niveles de evaluación no mostraron una diferencia de WER estadísticamente detectable frente a la base entrenada solo con WER y el mismo programa de entrenamiento.
Esos porcentajes describen medidas distintas. Reducir las inserciones un 22,3 % no significa reducir todos los errores de transcripción un 22,3 %. La mejora de WER en campo lejano fue de 1,18 puntos porcentuales. Una evaluación de producto que solo registre el WER total perdería gran parte del cambio en la composición de errores.
El alcance es concreto. Los experimentos usan una política Qwen2-Audio-7B adaptada con LoRA y un evaluador wav2vec2-CTC de 0.3B congelado. Los autores describen un mecanismo demostrado en una configuración de modelo. Los resultados no demuestran mejoras equivalentes para otros modelos, idiomas o condiciones de llamadas en producción.
¿Cómo funciona el evaluador acústico?
Durante el entrenamiento, la política muestrea grupos de ocho transcripciones candidatas. Un modelo CTC congelado, preentrenado por separado, las puntúa frente al audio. La recompensa combina esa puntuación acústica con un término basado en la tasa de error de palabras. Las salidas por trama del evaluador se reutilizan entre los candidatos de cada enunciado.
La sección de método sitúa el evaluador adicional en el entrenamiento. Durante la inferencia, la política realiza una única decodificación voraz sin ese evaluador externo. El artículo no compara la latencia de extremo a extremo con modelos de producción.
La recompensa también tiene límites. Su normalización depende de la longitud de los candidatos y el evaluador pierde fiabilidad con una degradación acústica intensa. El artículo informa de más eliminaciones junto con menos inserciones. En una aplicación importan ambos errores. Omitir un elemento solicitado e inventar uno pueden tener consecuencias distintas.
¿Puede la reevaluación durante la inferencia reproducir el resultado?
Los autores probaron una configuración de reevaluación CTC de los 32 mejores candidatos sobre la política base. No recuperó las mejoras de inserción de la política entrenada con retroalimentación acústica. Es evidencia sobre esa configuración, no una exclusión de todos los métodos posibles de reevaluación.
Los autores actualizan los pesos mediante posentrenamiento por refuerzo. El artículo no evalúa cambios de configuración en API de transcripción alojadas. Sus experimentos de confianza sin evaluador ofrecen otra línea que investigar. Para producción, recomendamos probar la abstención basada en confianza con audio representativo e informar del efecto sobre la cobertura.
¿Qué debe medir un equipo de agentes de voz?
Una evaluación práctica debe conservar el audio y la transcripción de referencia e informar de inserciones, eliminaciones y sustituciones junto con WER. Agrupa los resultados por condición de grabación. Incluye los solapamientos, ruidos de fondo y distancias de micrófono que realmente encuentra la aplicación.
También revisaríamos ejemplos donde la transcripción cambia una acción. Una cantidad inventada, una negación omitida o un nombre alterado pueden importar más que varias diferencias inocuas de redacción. Es una recomendación de evaluación, no un resultado medido en este artículo.
Los tiempos de turno deben evaluarse por separado. Ink 2 expone eventos de ciclo de turno como turn.start, turn.eager_end y turn.end. Permiten coordinar escucha y respuesta, pero no demuestran que una transcripción sea correcta. Este artículo no evalúa Ink 2 ni demuestra que los ajustes de detección de final reproduzcan sus resultados de recompensa acústica.
¿Cuáles son los límites de la evidencia?
Conviene leer la configuración de evaluación y las limitaciones antes de adoptar el método. Entrena con LibriSpeech y aumento de datos mediante ruido añadido, y evalúa seis condiciones, incluidas reuniones de AMI. Las 33.282 instancias de enunciado y condición no son todas grabaciones independientes. Los enunciados de LibriSpeech se repiten con distintos ruidos y ambas condiciones AMI proceden del mismo conjunto de reuniones.
AMI se excluyó del entrenamiento por refuerzo, pero sí informó una decisión diagnóstica sobre qué condiciones acústicas incluir en el entrenamiento. Decir que no intervino en absoluto antes de la evaluación final exageraría la separación.
El resultado útil es una reducción de inserciones en una configuración definida de entrenamiento y evaluación. Para quienes evalúan reconocimiento de voz, la lección inmediata es examinar qué errores cambiaron. Un WER agregado menor no indica por sí solo si el modelo tiene menos tendencia a inventar palabras.