Conceptos de voz con IA que debes conocer
Cuando tu agente interrumpe al usuario en mal momento, ¿es un problema de voz a texto, STT? ¿De detección de actividad vocal, VAD? ¿O no se detuvo el modelo de texto a voz durante la generación?
Son tres problemas diferentes, con soluciones distintas y situados en partes diferentes del proceso.
Por eso, crear agentes que conversen de verdad es mucho más difícil que elegir un modelo STT o TTS.
En Cartesia creamos IA para que las personas se expresen y sean comprendidas.
La comprensión empieza con un vocabulario común.
Este artículo te da los términos para comprender, explorar y razonar sobre agentes conversacionales, y para interpretar las pruebas que parecen publicarse cada pocos días.
Los he agrupado por secciones para darles contexto. Ya sabes: el contexto lo es todo, especialmente en IA.
Componentes básicos del proceso de voz
-
STT, voz a texto. Convierte habla de entrada en texto. STT y ASR, reconocimiento automático del habla, suelen usarse indistintamente.
Cada vez que dictas un mensaje al móvil, usas STT o ASR.
En una conversación natural entre persona e IA, este es el canal por el que la persona comunica información al sistema, aunque solo sea una parte de él.
Puedes probar gratuitamente los modelos STT de Cartesia, llamados Ink, aquí. Ponlos a prueba con teléfonos, fechas y correos electrónicos deletreados.
-
VAD, detección de actividad vocal. Son modelos clasificadores especializados, distintos del modelo que transcribe. Detectan:
-
Silencio frente a sonido en una señal de entrada.
-
Habla frente a sonido de fondo.
Filtran la señal para aislar el habla y después la envían al modelo ASR.
Ink-2 gestiona los turnos internamente. Esto simplifica el sistema porque no necesitas evaluar, integrar y mantener un VAD separado solo para saber cuándo habla el usuario.
-
-
Detección de turnos. También se denomina endpointing, aunque puede confundirse con endpoints de API. Aquí usaremos detección de turnos.
Es la capacidad de identificar si quien llama ha empezado, terminado o retomado su intervención. Resulta más difícil de lo que parece: puede estar haciendo una pausa, pensando, distraído o respirando.
Es esencial para la experiencia. Un modelo demasiado impaciente produce interrupciones molestas. Uno lento añade milisegundos de latencia y silencios incómodos.
Un VAD poco fiable junto con cierres prematuros de turno hace que el usuario sienta que la IA no le deja hablar.
La mala detección destruye la fluidez y también puede producir errores de transcripción que se acumulan y perjudican acciones posteriores.
Históricamente, VAD y detección de turnos usaban señales indirectas como la duración de las pausas. Modelos recientes como Ink-2 incorporan esa detección en el propio modelo.
-
TTS, texto a voz. Hace lo contrario de STT: convierte texto en habla sintética. Tiene aspectos más subjetivos, que veremos después.
Existe desde hace décadas. Antes sonaba robótico, pero los buenos modelos actuales suenan naturales. Puedes probar gratuitamente Sonic, nuestros modelos TTS, aquí.
Funciones de la IA conversacional de voz
-
Barge-in, gestión de interrupciones. Es fundamental para conversar.
La IA conversacional empresarial exige mucho más que conectar STT y TTS a un chatbot. Debe manejar conversaciones humanas imprevisibles, con variaciones de entorno, región y calidad.
Barge-in permite interrumpir a la IA y hacer que deje de hablar. El TTS debe saber que el usuario ha empezado o retomado el habla, algo que STT o VAD detectan antes en el proceso.
Requiere más que detección de turnos. Hay que diseñar bien los modelos y el sistema que los coordina.
Cuando STT emite el evento de inicio o reanudación, la capa de orquestación debe silenciar inmediatamente el flujo TTS. No es trivial, pero es viable con buena ingeniería.
En Cartesia usamos una arquitectura basada en eventos para coordinar agentes de voz. Así, el sistema observa cada evento y responde adecuadamente.
-
Aislamiento de voz y reducción de ruido. Algunos modelos reducen el ruido ambiental o separan la conversación activa de otras de fondo. Importa en oficinas, cafeterías, aeropuertos, centros de llamadas, hospitales y lugares concurridos. Es difícil y los modelos difieren en su capacidad.
Prestamos especial atención a este aspecto en Ink-2, porque los usos empresariales suelen tener ruido ambiental y estar lejos de un estudio.
Características de la voz
Son importantes, pero muy subjetivas. Si tú y tu mejor amigo discrepáis sobre la voz de un actor, es por esa subjetividad.
Estos ejemplos muestran voces más o menos adecuadas por su tono y expresión emocional:
Buena prosodia
Prosodia plana
Expresión emocional natural
Expresión emocional exagerada
Las características indeseables suelen detectarse más fácilmente que las deseables. Prestar atención permite percibir excesos o carencias y decidir si una voz sirve para su propósito.
-
Prosodia. Combina tono y entonación, volumen, duración y ritmo. Es el “cómo” del habla y reúne atributos técnicos para analizar una voz.
Volumen y ritmo se entienden fácilmente; conviene aclarar la entonación.
Es cómo sube y baja la voz. Nos indica si oímos una pregunta o afirmación, continuación o cierre, énfasis o neutralidad. Por ejemplo, elevar el tono al final suele señalar una pregunta.
La prosodia añade significado e impacto a las palabras. “¿Johnny mordió al perro?” y “¡Johnny mordió al perro!” provocarían reacciones muy distintas en una investigación escolar.
-
Expresión emocional. Está relacionada con la prosodia porque es su efecto. Los humanos detectamos y clasificamos emociones en la voz. En IA, la expresividad debe encajar con el uso previsto.
-
Timbre. Es la cualidad tonal. Suele describirse con adjetivos: una voz de radio puede ser cálida, rica, oscura o aterciopelada; un cantante, nasal o áspero. El timbre aporta identidad, resonancia emocional, autoridad o confianza.
-
Velocidad y ritmo. No se trata solo de cuántas palabras por minuto puede rapear Eminem. También importa la cadencia y dónde y cuánto se pausa. Un buen ritmo facilita seguir el audio con pausas acordes con la puntuación.
-
Voz crepitante, vocal fry. Es una vibración grave y crujiente que aparece cuando el aire pasa lentamente por las cuerdas vocales. Aporta realismo porque las personas la producen naturalmente al terminar frases.
Para la IA es un equilibrio delicado. ASR puede confundirla con ruido o silencio. Al entrenar TTS, un exceso actúa como ruido y produce fallos.
Buscamos un equilibrio natural: suficiente para evitar un sonido robótico, pero sin distorsionar la voz ni reducir su inteligibilidad.
-
Localización, dialectos y pronunciación. Para inspirar confianza, TTS debe sonar local. Hace falta más que acento: la normalización interpreta abreviaturas, fechas y monedas según la región. Por ejemplo, si “12/01” significa 12 de enero o 1 de diciembre, o si “Sr.” significa “Senior” o “Señor”.
Esa es la capa semántica. La fonética incluye acento, pronunciación y claridad. Un modelo puede normalizar correctamente y sonar extraño en Bombay o Dublín. Pronunciar mal nombres, marcas o términos técnicos rompe la personalidad de marca y afecta a la confianza.
Un agente de calidad debe acertar en qué dice y cómo suena para su público. Por ejemplo:
-
Señales de escucha, backchanneling. Son expresiones breves como “ajá”, “vale”, “entendido” o “sí” que muestran que seguimos la conversación.
No son turnos completos, solo señales de reconocimiento.
Funcionan en dos direcciones: TTS debe producirlas cuando corresponde para no sonar distante, y ASR debe reconocerlas como señales de escucha y no interrupciones.
Un agente que interpreta “ajá” como interrupción, o nunca indica que escucha, parece fallar aunque el sistema funcione correctamente.
Métricas de rendimiento
-
Fidelidad al texto. Mide cuánto se ajusta el habla TTS al texto de entrada. Incluso los modelos avanzados pueden alucinar palabras u omitir frases. También se comprueba si arrastran palabras o producen pronunciaciones extrañas que se apartan del guion.
Sin alta fidelidad, un modelo no sirve para leer textos legales o médicos donde la precisión semántica es esencial.
-
Tratamiento alfanumérico. Mide la fiabilidad al pronunciar datos ajenos al diccionario, como teléfonos, identificadores de seguimiento, fechas y correos.
Parte de la normalización. Primero hay que interpretar el formato, como MM-DD o DD-MM para “12/01”, y después pronunciarlo bien. Leer un teléfono como un entero enorme en vez de dígito a dígito resulta desconcertante, especialmente en sanidad, finanzas o logística.
-
RTF, factor de tiempo real. En STT mide la velocidad de transcripción dividiendo el tiempo de procesamiento entre la duración del audio.
Si la IA tarda 30 segundos en transcribir una grabación de 60 segundos, RTF es 0,5 y funciona más rápido que el tiempo real. Con RTF igual a 1 tarda lo mismo que el audio. Por encima de 1, es más lenta.
En TTS mide el tiempo para generar audio a partir del texto.
| STT/ASR | TTS |
|---|---|
| Entra audio y sale texto. | Entra texto y sale audio. |
| RTF = tiempo de transcripción / duración del audio de entrada | RTF = tiempo de síntesis / duración del habla generada |
-
TTFS, tiempo hasta el segmento final. Medir RTF no tiene suficiente detalle para conversaciones en directo.
Importa TTFS, también llamado TTCT, tiempo hasta completar la transcripción. Mide el intervalo entre el final del turno del usuario y la transcripción definitiva, lista para que actúe el LLM.
Es distinto de otro TTFS, tiempo hasta el primer segmento, que solo mide cuándo llega el primer fragmento. TTCT mide cuándo está todo terminado. El segmento final es el punto de entrega relevante porque lo que sigue depende de él.
-
TTFB, tiempo hasta el primer byte. Mide la reacción del TTS: desde que recibe texto hasta que empieza a devolver los primeros bytes de audio.
Un TTFB inferior a 300 ms solía ser la referencia para una conversación natural. Más tiempo produce el retraso incómodo de un walkie-talkie.
En Cartesia hemos ido más allá. Los modelos Sonic 3 alcanzan entre 40 y 90 ms, menos que un parpadeo humano de unos 100 ms.
Así hacemos real el tiempo real.
-
MOS, puntuación media de opinión. Existe porque percibir calidad, naturalidad, confianza o adecuación es subjetivo. Una voz buena para meditación puede no servir para triaje médico. Tradicionalmente puntúan paneles humanos; hoy también se usan modelos de IA para predecir esas puntuaciones.
MOS es la media de las puntuaciones de oyentes en una escala de 1 a 5. Estructura esa subjetividad para evaluar una voz según las expectativas y preferencias del público.
Esto la hace especialmente relevante en IA conversacional, donde la calidad depende tanto del contexto y del uso.
-
WER de STT, tasa de error de palabras. Mide el porcentaje literal de palabras mal transcritas. A veces esa exactitud literal importa.
En agentes conversacionales, puede ser una métrica poco útil.
Una transcripción ya no necesita ser exacta al 100 % para ser eficaz al 100 %, porque los LLM interpretan muy bien el contexto. Por ejemplo, tratan “gonna” y “going to” de la misma forma.
Resulta más útil la WER semántica, que mide si el texto transmite la intención del usuario en lugar de penalizar cada muletilla o coma.
Insistir demasiado en WER literal también puede añadir latencia. La métrica semántica se centra en si la IA comprende y atiende la intención.
-
WER de TTS. Mide lo bien que el habla generada corresponde al texto: si articula las palabras correctas, gestiona pronunciaciones complejas e inventa u omite palabras.
Crear IA que converse exige más que conectar modelos rápidos a un LLM. La conversación humana es desordenada, ruidosa e imprevisible. Diseñar agentes eficaces exige equilibrar ingeniería y atributos humanos sin perder calidad, exactitud ni velocidad.
En Cartesia creemos que el potencial de los agentes empieza por diseñar y controlar con precisión toda la experiencia. Esta idea guía cómo diseñamos, entrenamos, construimos, evaluamos y desplegamos nuestros SSM. Cada capa debe encajar de forma intencionada, teniendo en cuenta compensaciones, resultados comerciales, objetivos de uso y calidad de ingeniería.
Queremos ayudarte a encontrar una voz intuitiva, fiable y humana. Escríbenos a business@cartesia.ai.
