La tasa de error de palabras, o WER, cuenta las diferencias entre una transcripción y una referencia. Ayuda a detectar palabras incorrectas o ausentes. No determina si una voz es adecuada para tu producto.
Dos clips generados pueden decir exactamente lo mismo y ofrecer experiencias muy distintas. Uno transmite tranquilidad; el otro parece encantado de que hayan cancelado tu vuelo. La transcripción supera la prueba. La conversación, no.
Nuestro enfoque, explicado en ¿Es bueno este modelo TTS?, parte de la experiencia que queremos ofrecer. Para los agentes de voz en tiempo real, significa entender la respuesta a la primera, escuchar una interpretación apropiada para la situación y conversar sin retrasos ni interrupciones incómodas. WER es una herramienta de diagnóstico dentro de esa evaluación, no una puntuación que debamos optimizar por separado.
Qué mide realmente la tasa de error de palabras
WER usa el número mínimo de modificaciones de palabras necesarias para alinear una transcripción con su referencia:
WER = (substitutions + deletions + insertions) / reference words
Multiplica por 100 para expresarlo como porcentaje. En este ejemplo en inglés, la transcripción sustituye “Tuesday” por “Thursday”:
Reference: please move my appointment to next Tuesday morning
Transcript: please move my appointment to next Thursday morning
WER = 1 / 8 = 12.5%
Es un error de una palabra que puede producir una cita incorrecta. WER le asigna el mismo peso que a cualquier otra sustitución. La consecuencia debe evaluarse en el producto.
La documentación de WER de Microsoft explica el cálculo; herramientas como JiWER calculan la alineación. Mantén constantes las reglas de normalización del texto y de referencia. Para calcular WER en un corpus, divide el total de modificaciones entre el total de palabras de referencia en lugar de promediar sin indicarlo los porcentajes de cada clip. Las inserciones pueden producir un WER superior al 100 %. Una referencia vacía requiere una convención de puntuación documentada porque la fórmula habitual divide entre cero.
El cálculo es el mismo en dos configuraciones de evaluación distintas:
| Evaluación | Qué se compara | Qué indica el resultado |
|---|---|---|
| Reconocimiento de voz (STT/ASR) | La transcripción del reconocedor frente a una referencia humana | Con qué frecuencia las palabras reconocidas difieren de la referencia |
| Texto a voz (TTS) | Una transcripción ASR del audio generado frente a las palabras previstas | Si la síntesis y el reconocimiento conservan juntos esas palabras |
En el segundo caso, evalúas el habla a través de otro modelo. Un aparente error de TTS puede proceder del reconocedor. Una transcripción correcta también puede ocultar habla poco clara. Hay que escuchar para saber qué ha ocurrido.
Por qué WER puede distorsionar las evaluaciones de TTS
Las mismas palabras pueden sonar muy distintas
Un texto no establece una única interpretación correcta. “No me lo puedo creer” puede expresar entusiasmo, enfado, tristeza o sarcasmo. Reconocer cada palabra no indica si la interpretación encaja con la situación.
Los ejemplos de audio emparejados de nuestro artículo sobre evaluación permiten oírlo. Dos clips pueden tener el mismo WER e interpretaciones distintas. Cuando los modelos pronuncian con fiabilidad las palabras previstas en un conjunto de pruebas, las pequeñas diferencias de WER pueden decir poco sobre las diferencias de calidad que importan a los oyentes. Añadir decimales no recupera información que la métrica nunca midió.
El reconocedor puede inventar y ocultar errores
Un modelo ASR puede tener dificultades con un acento, un idioma o un nombre desconocido aunque los oyentes previstos entiendan claramente el habla generada. Eso eleva WER sin demostrar un fallo de síntesis.
También ocurre lo contrario. Un reconocedor puede deducir por el contexto una palabra poco clara y devolver la transcripción prevista. Una persona que intenta entender un código de cuenta por teléfono quizá no tenga tanta suerte.
Mantén el reconocedor y las reglas de puntuación constantes en las pruebas de regresión. Escucha los clips señalados antes de atribuir los errores al TTS. Revisa también una muestra de los que superan la prueba. Si solo analizas fallos, no detectarás los casos en los que ASR corrigió la salida. Un reconocedor fijo hace las comparaciones más consistentes, pero no elimina sus puntos ciegos.
La corrección depende del contexto
Una transcripción puede contener “read” tanto si el modelo lo pronuncia en presente como en pasado en inglés. Las palabras coinciden, pero la pronunciación puede ser incorrecta para la frase.
Las fechas escritas presentan un problema similar. “07/08/2026” puede significar el 8 de julio en un contexto estadounidense o el 7 de agosto en uno británico. El producto debe establecer la configuración regional prevista antes de que una referencia pueda determinar la corrección. Ninguna interpretación debería penalizarse solo porque quien escribió la referencia supuso la otra.
Algunas diferencias son inocuas. “$25” y “veinticinco dólares” pueden representar la misma cantidad. Otras cambian el significado. Define las formas habladas aceptables para la tarea y distingue entre una diferencia de formato y una fecha, cantidad o identificador incorrectos. La normalización del texto no debe borrar errores que importen a quien llama.
Dónde ayuda el WER semántico
El WER semántico intenta distinguir las diferencias de redacción que conservan el significado de los errores que lo cambian. “Veinticinco dólares” y “$25” pueden significar lo mismo; “quince dólares”, no. Una puntuación que tenga en cuenta el significado puede complementar el WER por palabras, sobre todo cuando la comparación literal exagera diferencias inocuas.
El método de puntuación importa. Define qué consideras equivalente y comprueba que el evaluador detecta cambios en nombres, cantidades y negaciones. No des por hecho que dos implementaciones de “WER semántico” son comparables. Incluso una coincidencia perfecta de significado no indica si la voz transmite tranquilidad, recita una dirección demasiado deprisa o presenta fallos entre fragmentos de audio. Añade un diagnóstico, no un veredicto sobre la calidad conversacional.
Empieza por la conversación que quieres facilitar
Antes de comparar modelos, describe la situación. ¿Quién escucha? ¿Qué idioma y variedad regional espera? ¿Oye una dirección por teléfono o una respuesta breve con auriculares? ¿Qué debe entender o hacer después?
Para un agente de atención que lee la confirmación de una cita, quizá exijas que la persona entienda la fecha y la hora a la primera, una interpretación tranquila y pausas suficientes entre los detalles para seguirlos. Un WER agregado menor no demuestra por sí solo que se cumplan esos requisitos.
Organiza la evaluación en torno a ellos. Para TTS conversacional, usamos dimensiones como estas:
| Dimensión | Pregunta que probar | Evidencias que recopilar |
|---|---|---|
| Corrección y claridad | ¿Los oyentes entienden correctamente nombres, números, direcciones y códigos? | Transcripciones de los oyentes y comprobaciones de los detalles críticos, con WER como diagnóstico |
| Corrección contextual | ¿La pronunciación o la expansión hablada son correctas en esta situación? | Revisión según reglas explícitas de región, dominio y lecturas aceptables |
| Interpretación apropiada | ¿El ritmo, el énfasis y la emoción encajan con la conversación? | Comparaciones de escucha con el escenario indicado |
| Capacidad de respuesta | ¿La persona espera demasiado o sufre interrupciones? | Tiempos de extremo a extremo y observaciones de la gestión de turnos del agente |
| Consistencia | ¿La voz del hablante se mantiene estable entre turnos? | Revisión de conversaciones completas para detectar cambios de voz, acento o interpretación |
| Comportamiento en streaming | ¿La reproducción en directo introduce empalmes, repeticiones o sonidos cortados? | Audio capturado mediante el flujo de streaming y reproducción previsto |
Algunas pruebas evalúan el TTS; otras, el agente completo. Mantén esa distinción al diagnosticar un fallo. Una interrupción puede proceder de la detección de turnos y una pausa larga, de una consulta al backend en vez de la generación de voz. La persona experimenta todos estos problemas, pero la solución depende de su origen.
Escucha en contexto y prueba el flujo en directo
La escucha humana es indispensable, pero una puntuación de preferencia tampoco es una verdad universal. Explica a los oyentes qué debe hacer la voz. Reúne a personas que entiendan el idioma y la variedad regional. Informa de las diferencias entre sus juicios en lugar de reducir todos los públicos a una sola media.
Para comparar modelos, controla el volumen de reproducción, el códec, la frecuencia de muestreo y el orden de presentación. Limita la duración de las sesiones para evitar la fatiga. Si evalúas el producto completo, conserva sus condiciones reales de telefonía o reproducción e indica ese alcance. De lo contrario, puedes confundir un problema del códec con uno del modelo o eliminar un fallo de producción al preparar la prueba.
Usa tanto clips breves como conversaciones completas. Una grabación cuidada generada sin conexión no puede revelar todos los fallos del habla producida mientras sigue llegando el texto de respuesta. Escucha si hay empalmes bruscos entre fragmentos, sílabas repetidas o una interpretación que empieza en la dirección equivocada y no consigue rectificar. En conversaciones largas, comprueba si cambian la voz o el acento.
Desglosa los resultados por región y tipo de fallo. Un modelo puede mejorar la pronunciación en un idioma y empeorar el ritmo en otro. Una puntuación global puede ocultar ambos cambios. Los predictores automáticos de calidad ayudan a detectar posibles regresiones, pero también necesitan validarse para tus idiomas y condiciones de audio. Sustituir WER por otra cifra única no resuelve el problema de evaluación.
Usa WER para investigar, no para declarar un ganador
WER sigue siendo útil para seguir regresiones a nivel de palabra y encontrar clips que convenga revisar. Pronunciar correctamente nombres y códigos alfanuméricos puede ser esencial. Conserva esas comprobaciones. Combínalas con evidencias de que el habla se entiende y resulta apropiada para la conversación donde se usará.
Cuando mejore una puntuación, pregunta qué cambió para el oyente. ¿Resulta más fácil entender una dirección? ¿Se recuperó una palabra ausente? ¿O un cambio de formato hizo coincidir la referencia y la transcripción? Son resultados distintos aunque el panel use la misma flecha verde.
Para escuchar esas diferencias, empieza por los ejemplos de audio de ¿Es bueno este modelo TTS?. Después prueba Sonic con tus propios textos conversacionales y configuración de streaming. Elige el modelo que cumpla los requisitos de tu producto en las dimensiones que importan a tus usuarios. Una puntuación de transcripción no puede decidirlo por sí sola.