¿Qué es el TTS neuronal? Así funcionan las voces

Rene, Kabir Goel 
¿Qué es el TTS neuronal? Así funcionan las voces

La síntesis de voz neuronal (TTS neuronal) es la síntesis de voz en la que una red neuronal, entrenada con horas de personas hablando, genera el audio. Antes, los ordenadores pegaban fragmentos de voz grabada o calculaban una voz a partir de reglas escritas a mano. El TTS neuronal aprende la pronunciación, el ritmo y la entonación a partir de datos, y por eso suena como una persona y no como un GPS anunciando «recalculando».

Si has llegado aquí porque un menú de ajustes o una consola en la nube te ofrecía una voz «neuronal»: elígela. Sonará bastante más natural. En una factura de la nube suele costar unas cuatro veces más que una voz estándar; lo vemos en la sección de precios.

Si estás eligiendo un modelo de voz para un producto, la pregunta útil en 2026 es qué TTS neuronal quieres. Casi todas las voces que vas a comparar son neuronales. Se diferencian en cómo generan el audio, en lo rápido que empiezan a hablar y en cómo manejan el texto que tu producto envía de verdad.

Lo que había antes del TTS neuronal

Dos enfoques antiguos siguen detrás de las voces «estándar» de la mayoría de las plataformas en la nube.

La síntesis concatenativa corta grabaciones de un hablante real en unidades pequeñas y las vuelve a unir. La documentación de Amazon Polly describe así su motor estándar: «concatena fonemas de voz grabada», y las costuras entre unidades limitan lo natural que puede sonar.

La síntesis paramétrica no usa grabaciones al reproducir. Un modelo predice parámetros acústicos y un vocoder de procesamiento de señal los convierte en sonido. La página de tipos de voz de Google Cloud dice que muchas de sus voces estándar usan una variante de esto. Es flexible y compacta, y de ahí viene ese tono algo zumbante y robótico que asociamos con el texto a voz antiguo.

Cómo funciona el TTS neuronal

Un sistema de TTS neuronal típico tiene tres etapas.

  1. Una etapa inicial normaliza el texto. «Dr. Lee, 221B Baker St., 4,50 $» tiene que convertirse en palabras que diría un hablante, y el modelo tiene que saber cómo se lee cada abreviatura y cada cifra en su contexto.
  2. Un modelo acústico predice cómo debería sonar la voz, normalmente como un espectrograma mel, una imagen de cómo se reparte la energía entre frecuencias a lo largo del tiempo. Aquí la red decide el ritmo, el acento y el tono.
  3. Un vocoder neuronal convierte ese espectrograma en una forma de onda que se puede reproducir.

Conviene conocer los hitos, porque los proveedores todavía ponen sus nombres a sus productos. WaveNet (2016), de DeepMind, generaba audio muestra a muestra, y los oyentes lo valoraron como más natural que los mejores sistemas paramétricos y concatenativos de la época. Tacotron 2 (2017), de Google, combinó un predictor de espectrogramas con un vocoder WaveNet y obtuvo una puntuación media de opinión de 4,53, frente a 4,58 de las grabaciones profesionales. HiFi-GAN (2020) hizo que el vocoding de alta calidad fuera lo bastante rápido para ser barato. El motor neuronal de Amazon sigue el mismo diseño en dos partes: una red secuencia a secuencia que produce espectrogramas, seguida de un vocoder neuronal.

La nueva generación: la voz como tokens

Desde aproximadamente 2023, muchos sistemas han dejado atrás el espectrograma. Un códec de audio neuronal, como EnCodec de Meta, comprime el audio en una secuencia de tokens discretos. Un modelo predice esos tokens como un modelo de lenguaje predice palabras, y el códec los vuelve a convertir en sonido. VALL-E, de Microsoft, mostró la ventaja: entrenado con 60.000 horas de inglés, podía imitar a un hablante nuevo a partir de una grabación de tres segundos.

Esto es lo que los proveedores en la nube venden ahora como voces «generativas» o «HD». Amazon describe su motor generativo como un transformer de mil millones de parámetros que convierte texto en códigos de voz, seguido de un decodificador que los emite como audio en streaming. Estos modelos leen mejor una frase con la intención correcta, ríen cuando toca y suenan a conversación. Tiene un coste. Microsoft dice que sus voces HD varían ligeramente en cada salida, y Amazon advierte de que una actualización del modelo puede cambiar cómo suena una voz. Si produces una temporada de un pódcast, importa. Si atiendes llamadas, casi nunca.

Dónde encajan los modelos de espacio de estados

Generar voz en tiempo real es un problema de secuencias largas: unos pocos segundos de audio son miles de pasos. La atención de un transformer revisa todo lo generado hasta el momento, así que cada paso nuevo cuesta más a medida que crece el audio. Un modelo de espacio de estados, en cambio, arrastra un resumen de tamaño fijo del pasado, así que cada paso cuesta lo mismo.

Los fundadores de Cartesia trabajaron en esa idea antes de que Cartesia existiera. Albert Gu y Karan Goel son coautores de S4, y Gu es coautor de Mamba con Tri Dao. Sonic, el modelo de TTS de Cartesia, se basa en esa familia de arquitecturas. Transmite el audio mientras lo genera con una latencia de modelo inferior a 90 ms, habla 44 idiomas, y Sonic 3.6 quedó primero en las dos clasificaciones de texto a voz de Artificial Analysis cuando se lanzó en agosto de 2026. Lo creamos para agentes de voz, donde quien llama oye cada milisegundo de retraso.

Qué significa «neuronal» en una página de precios

Los proveedores en la nube usan la palabra como nivel de precio. Esto es lo que publicaban Amazon y Google el 3 de octubre de 2026, por millón de caracteres:

ProveedorVoces antiguasNeuronalNivel más reciente
Amazon PollyStandard: 4 $Neural: 16 $Generative: 30 $; Long-Form: 100 $
Google CloudStandard: 4 $Neural2: 16 $Chirp 3: HD: 30 $

Destacan dos cosas. Primero, los nombres no coinciden entre proveedores, así que compara por arquitectura y escuchando, no por la etiqueta. Google cobra ahora sus voces WaveNet, el gran avance neuronal de 2016, a los mismos 4 $ que las voces estándar. Segundo, el nivel más reciente cuesta aproximadamente el doble que el neuronal. Si vale la pena depende de tu texto y de tus oyentes, y eso solo lo sabrás probando.

Cómo saber si una voz neuronal es buena

Todos los proveedores te dirán que sus voces suenan humanas. Las pruebas útiles son las que se parecen a tu producto:

  • Envía las cadenas que oirán tus usuarios: números de pedido, direcciones de correo, fechas, precios y nombres. Los modelos neuronales fallan en ellas de forma distinta que en frases normales.
  • Escucha en contexto. Una frase que suena bien sola puede tener el tono equivocado después de una disculpa.
  • Mide el recorrido que vive tu usuario. En una conversación en directo, es el tiempo hasta el primer audio por una conexión en streaming, no lo que tarda en generarse un archivo completo.
  • Prueba pasajes largos y todos los idiomas que vayas a lanzar. El ritmo se desvía y los acentos se cuelan de formas que las demos cortas esconden.

Nuestro equipo de investigación escribió un texto más largo sobre esto, Is this TTS model good?, que explica por qué ninguna puntuación única zanja la cuestión.

TTS neuronal de código abierto

Puedes ejecutar TTS neuronal gratis en tu propio hardware. Piper es un motor local rápido muy usado en domótica. Kokoro es un modelo de 82 millones de parámetros con licencia Apache. Los dos son buenas opciones para leer texto en voz alta en un dispositivo sin conexión de red. No están pensados para streaming de baja latencia con volumen de centro de llamadas, que es el trabajo que hace Sonic.

Para oír la diferencia, pega una frase que diga tu producto en el playground de Cartesia. El plan gratuito incluye créditos suficientes para probarlo con tu propio texto.

Preguntas frecuentes

¿Qué es el TTS neuronal?

La síntesis de voz neuronal (TTS neuronal) es la síntesis de voz en la que una red neuronal, entrenada con grabaciones de personas hablando, genera el audio. Los sistemas anteriores unían fragmentos de voz grabada o usaban procesamiento de señal diseñado a mano. El TTS neuronal aprende la pronunciación, el ritmo y la entonación a partir de datos, y por eso suena mucho más parecido a una persona.

¿Qué diferencia hay entre las voces TTS neuronales y las estándar?

En los servicios en la nube, «estándar» suele significar una voz concatenativa o paramétrica antigua y «neuronal», una voz generada por una red neuronal. La documentación de Amazon Polly, por ejemplo, dice que sus voces estándar concatenan fonemas de voz grabada, mientras que su motor neuronal predice espectrogramas con una red neuronal y los convierte en audio con un vocoder neuronal. Las voces neuronales suenan más naturales y cuestan más: el 3 de octubre de 2026, Polly cobraba 4 $ por millón de caracteres en voces estándar y 16 $ en neuronales.

¿El TTS neuronal es lo mismo que una voz de IA?

En la práctica, sí. Todos los generadores de voz con IA modernos son modelos de TTS neuronal. Los sistemas más recientes, a veces llamados voces generativas, siguen siendo redes neuronales; solo que predicen tokens de audio comprimido como un modelo de lenguaje predice palabras, en lugar de predecir un espectrograma.

¿Puede el TTS neuronal funcionar en tiempo real?

Sí, si el modelo hace streaming. Un modelo en streaming empieza a enviar audio antes de terminar de generar la frase, así que la reproducción puede comenzar casi de inmediato. Sonic de Cartesia, por ejemplo, tiene una latencia de modelo inferior a 90 ms y transmite el audio mientras lo genera, que es lo que necesitan los agentes de voz telefónicos.

¿Cuánto cuesta el TTS neuronal?

Depende del proveedor y del nivel. El 3 de octubre de 2026, Amazon Polly cobraba 16 $ por millón de caracteres en voces neuronales y 30 $ en voces generativas, y Google Cloud cobraba 16 $ por millón de caracteres en Neural2 y 30 $ en Chirp 3 HD. Los modelos de código abierto como Piper y Kokoro son gratuitos en tu propio hardware. Los precios de Cartesia están en su página de precios, con un plan gratuito para empezar.