Blog / Noticias

La ronda de serie A y el futuro de la voz con IA

Karan Goel 
La ronda de serie A y el futuro de la voz con IA

En Cartesia estamos construyendo el futuro de la voz con IA: ultrarrealista, rápida y controlable. Durante el último año, nuestra tecnología ha intervenido en millones de llamadas y ha ayudado a decenas de miles de creadores a hacer más accesibles sus contenidos.

Anunciamos nuestra ronda de serie A de 64 millones de dólares, liderada por Kleiner Perkins. La nueva financiación nos ayudará a ampliar el equipo e invertir en investigación para crear la próxima generación de modelos, infraestructura y productos de voz. Empezamos con el lanzamiento de nuestro nuevo modelo de generación de voz, Sonic 2.0.

Sonic 2.0 se basa en nuestra nueva arquitectura de modelos de espacio de estados y es el modelo de voz más rápido y controlable disponible hoy. Tiene el doble de tamaño que Sonic, pero funciona más rápido, con solo 90 ms de latencia en el modelo completo y 40 ms en turbo. En evaluaciones ciegas de comparación directa con 100 voces reservadas para la prueba, 1,5 veces más personas prefirieron Sonic 2.0 frente al siguiente mejor proveedor.

Además de velocidad y calidad, Sonic 2.0 ofrece un control sin precedentes sobre las generaciones, con una clonación de voz líder en su categoría que capta acentos complejos y entornos sonoros ricos. También presentamos dos nuevos endpoints:

  • Voice changer: perfecciona el estilo y la voz de tu audio.
  • Infill: edita el contenido dentro de tu audio sin cortes perceptibles.

Estamos creando la plataforma para voz con IA con infraestructura de nivel empresarial. La API de Sonic está diseñada para desarrolladores y cuenta con la infraestructura de servicio más fiable y rápida para generar voz, con una disponibilidad del 99,9 % y las latencias P90 más rápidas a escala mundial. Cumplimos SOC-2 e HIPAA y admitimos despliegues en tiempo real en las instalaciones del cliente y en el dispositivo.

También seguimos avanzando en nuestra investigación a largo plazo. La próxima generación de modelos de audio exigirá avances algorítmicos en varios campos, como las arquitecturas de streaming, los códecs, el modelado de contextos largos y la inferencia en el dispositivo. Queremos compartir aquí nuestros progresos.

Descubre nuestro trabajo en voz con IA en cartesia.ai/sonic. Si te interesa trabajar con nosotros, ponte en contacto.