En Cartesia invertimos en avances fundamentales de arquitecturas y algoritmos de IA porque permiten dar saltos en las capacidades de los modelos.
Sonic-3.6 reúne nuestros últimos avances en arquitecturas que aprenden eficientemente de audio multilingüe durante el preentrenamiento y el entrenamiento posterior. Mejora considerablemente la naturalidad y la calidad frente a Sonic-3.5. Los oyentes lo prefieren en hasta el 93 % de las comparaciones ciegas directas en quince variantes regionales.
A principios de año apostamos por replantearlo todo desde los fundamentos, en lugar de ajustar gradualmente el enfoque existente. Desde entonces hemos reconstruido datos, arquitectura, entrenamiento y evaluación con ideas nuevas, y empezamos a ver los resultados.
Sonic-3.6 llega solo dos meses después de Sonic-3.5 y vuelve a ocupar el número 1 en Artificial Analysis, tanto en voz controlada como en voces de proveedores. En la primera, supera a nuestro propio Sonic-3.5. Haberlo adelantado mientras ningún otro proveedor ha cerrado la distancia refleja la aceleración de nuestra investigación.


Más cerca del habla natural
Para quien opera voz a escala, la naturalidad decide si el cliente sigue en línea. Una voz ligeramente sintética puede hacerle perder confianza y pedir una persona. Creamos Sonic-3.6 para sonar natural y nativo y mantener la conversación en 44 idiomas.
En inglés estadounidense, los oyentes eligieron Sonic-3.6 frente a Eleven v3 el 92 % de las veces en pruebas ciegas directas, gracias a mejor entonación, calidad vocal y emoción guiada por el contexto. Lee cada frase como debería oírse y adapta la interpretación a la conversación. La demostración conserva su audio y texto originales en inglés.
I understand things are difficult right now. We can start with a smaller amount, around $35 a month, and adjust it later. There's no pressure to commit to more than you can manage.
Eleven v3
Sonic-3.6
¿Hablas español?
Siempre hemos considerado el inglés un requisito básico. Sonar nativo en los demás idiomas y acentos determina si la voz con IA seguirá siendo principalmente una tecnología en inglés o si todo el mundo podrá hablar con ella. Muchos modelos se entienden fuera de su idioma principal, pero pocos reproducen de forma convincente el acento, el tono y la pronunciación local de nombres o lugares.
Evaluamos Sonic-3.6 como lo haría un cliente: escuchándolo en cada idioma y comparándolo con proveedores líderes. Los paneles de hablantes nativos prefirieron Sonic-3.6 en todos los idiomas principales evaluados.
Preferencia de hablantes nativos
Comparación ciega directa con el principal competidor de cada región.
Nota metodológica: comparamos el principal competidor de cada idioma con una voz similar de Sonic-3.6. Generamos audio con textos idénticos y pedimos a paneles de hablantes nativos que evaluaran cada pareja a ciegas. Proporción de votos = victorias del modelo ÷ total de votos válidos
Estas mejoras permiten:
- Llegar a más personas: ya hay 61 variantes regionales, 11 de ellas de lenguas índicas, y más de 500 voces predefinidas. Se añaden odia y urdu, ambos con una exactitud de transcripción superior al 96 % desde el lanzamiento.
- Usar hinglish: alterna hindi e inglés en una sola generación con textos en devanagari, alfabeto latino o una combinación.
- Conservar mejor los acentos en clones instantáneos: Sonic-3.6 mantiene mucho mejor el acento del hablante, incluidos los menos extendidos.
- Adaptarse a la región: usa el campo opcional locale para pronunciar fechas, horas y números como lo haría una persona de esa región.
Alterna con naturalidad entre hindi e inglés, conservando el texto original de la grabación:
हमारी टीम ने पिछले quarter में customer feedback के आधार पर 12/08/2026 को नया mobile app launch किया, जिससे revenue में लगभग पंद्रह प्रतिशत की growth देखी गई।
Lee la fecha como una persona australiana, con audio y texto originales en inglés australiano:
Right, so I've confirmed your Qantas booking, QF11, departing Sydney on 21/07/2026. You're in seat 32A, you've got one checked bag at twenty-three kilos, and check-in opens three hours before the 9:50am departure.
Diseñado para producción
La naturalidad puede ganar una demostración, pero la llamada real es la prueba decisiva. Sonic-3.6 está diseñado para cargas empresariales a escala:
- Responde en menos de 90 ms y genera casi dos veces más rápido que v3 Conversational: 132 frente a 68 caracteres por segundo.
- Funciona a escala en la nube, en instalaciones propias y mediante endpoints regionales, con un SLA de disponibilidad del 99,9 %.
- Atiende millones de llamadas en producción con la fiabilidad que exige ese volumen.
- Se despliega en tu nube mediante Baseten, Amazon SageMaker o Together AI, para que el audio no tenga que salir de tu infraestructura.
- Cumple requisitos empresariales de SOC 2, PCI, HIPAA y RGPD.
- Se adapta a tu marca con ayuda directa de nuestro equipo para desarrollar y encontrar tu voz personalizada.
Escúchalo
Sonic-3.6 ya está disponible de forma general en Playground y mediante la API.
Pruébalo pronto. Al ritmo que vamos, quizá publiquemos otro antes de que termines la integración.
