Un modelo de texto a voz, TTS, genera habla. Pero el modelo y la voz con la que habla son cosas distintas.
Si conoces los LLM, una voz es algo parecido a una instrucción de sistema: el modelo aporta la capacidad general y la entrada determina qué genera.
En TTS, la voz suele ser una entrada independiente del modelo y da forma a su respuesta. Esa respuesta, el audio, es mucho más compleja que el texto. El modelo debe saber qué decir, cómo, a qué ritmo y volumen, con qué entonación, prosodia y énfasis. Son las muchas características y métricas de una “buena voz”. Normalmente querrías especificarlas, pero la mayoría de los modelos TTS permiten indicar una o dos entradas: el texto y una voz seleccionada.
Entradas de un modelo de voz
Un modelo de un solo hablante recibe una única entrada, el texto. Se entrena para hablar con una voz concreta, codificada en sus pesos aprendidos. No recibe la voz como entrada.
Por eso, sea cual sea el texto, devuelve audio que siempre suena como la misma persona.
Modelo de un hablante + texto = habla con una sola voz
Si solo oyes la voz que trae el modelo, ambos parecen lo mismo. No puedes separarlos claramente durante el uso normal. Para producir otro hablante hay que adaptar o volver a entrenar el modelo.
En cambio, un modelo multihablante acepta la selección de voz como otra entrada. Proporcionas el texto y eliges una voz de una lista fija compatible con el modelo.
Modelo multihablante + texto + hablante seleccionado = habla con esa voz
El modelo de síntesis sigue siendo el mismo, pero la voz seleccionada cambia las características del habla.
Mantén el texto y cambia la voz: sonará como otra persona. Estos ejemplos conservan su audio y transcripción originales en inglés.
Same words, different voice, same model.
Voz A
Voz B
La clonación zero-shot admite un hablante nuevo
Un modelo de clonación zero-shot puede condicionar el habla para que suene como alguien ajeno a su catálogo. Recibe un texto y un clip de audio de referencia que actúa como instrucción.
Modelo de clonación + texto + audio del hablante = voz clonada
Como el audio contiene más información que el texto, el clip permite un control más preciso de la voz sintetizada. Se llama zero-shot porque el sistema puede trabajar con un hablante con el que nunca se ha entrenado ni ajustado.
Durante la generación, generaliza a partir del audio de referencia.
Así funciona Instant Voice Cloning, IVC, de Cartesia.
Proporcionas un clip corto de tu voz como referencia. Bastan entre 10 y 60 segundos para condicionar el modelo. Sonic de Cartesia, un modelo TTS de extremo a extremo que también clona voces, extrae las características de la grabación y las utiliza para generar habla que suene como tú.
La clonación de voz profesional, PVC, utiliza más grabaciones para ajustar el modelo. Va más allá de condicionarlo durante la ejecución con una muestra: actualiza y adapta el propio modelo. A diferencia de IVC, necesita más tiempo, hasta un par de horas. Hemos observado que los PVC de Cartesia pueden reproducir incluso elementos no deseados, como golpes de aire en el micrófono, artefactos del equipo o ruido de fondo. En muchos casos de uso, eso es precisamente lo que se prefiere.
Una grabación contiene más que la identidad
Los clientes piden voces “más ásperas”, “más cálidas” o “más seguras”. Un clip también contiene ritmo, pausas, ruido de la sala, sonidos de la boca y detalles de esa interpretación. El sistema debe distinguir los rasgos del hablante de los de la grabación.
Las pausas largas pueden afectar al ritmo generado. El ruido de fondo puede reducirse, ignorarse o reproducirse. Dos modelos pueden responder de forma distinta al mismo material.
La guía de clonación de Cartesia recomienda audio limpio, pausas cortas y una interpretación adecuada al uso previsto.
Una voz centrada y mesurada sirve para atención al cliente, pero en una disputa de facturación puede parecer distante o poco empática. Una voz animada puede aportar energía a una demostración de producto o un asistente de bienvenida. Tienen distintas características del habla, aunque las genere un mismo modelo.
“¿Cómo elegir una voz?” y “¿Es bueno este modelo TTS?” son preguntas distintas. Confundirlas significa intentar corregir el problema equivocado cuando tu agente no suena bien.
