Chez Cartesia, nous construisons l’avenir de l’IA vocale : ultra-réaliste, rapide et contrôlable. Au cours de l’année écoulée, nous avons alimenté des millions d’appels et aidé des dizaines de milliers de créateurs à rendre leur contenu plus accessible.
Nous annonçons une série A de 64 millions de dollars menée par Kleiner Perkins. Ce financement nous aidera à agrandir notre équipe et à investir dans la recherche pour construire la prochaine génération de modèles, d’infrastructures et de produits vocaux, à commencer par le lancement de notre dernier modèle de génération vocale, Sonic 2.0.
Sonic 2.0 repose sur notre nouvelle architecture de modèles à espace d’états. C’est le modèle vocal le plus rapide et le plus contrôlable disponible aujourd’hui. Il est deux fois plus grand que Sonic, mais fonctionne plus vite, avec seulement 90 ms de latence pour le modèle complet et 40 ms pour la version turbo. Lors d’évaluations comparatives à l’aveugle sur 100 voix réservées au test, 1,5 fois plus de personnes ont préféré Sonic 2.0 au deuxième meilleur fournisseur.
Au-delà de la vitesse et de la qualité, Sonic 2.0 offre un contrôle inédit des générations, avec un clonage vocal de premier plan qui reproduit les accents complexes et les environnements sonores riches. Nous avons aussi introduit deux nouveaux points de terminaison :
- Modification de voix : ajustez le style et la voix de votre audio.
- Infill : modifiez le contenu à l’intérieur de votre audio sans rupture audible.
Nous construisons une plateforme d’IA vocale dotée d’une infrastructure de niveau entreprise. L’API Sonic est conçue pour les développeurs et dispose de la pile de service la plus fiable et la plus rapide pour la génération vocale, avec 99,9 % de disponibilité et les latences P90 les plus rapides au monde. Nous sommes conformes à SOC-2 et HIPAA et prenons en charge les déploiements en temps réel sur site et sur appareil.
Enfin, nous poursuivons notre programme de recherche à long terme. La prochaine génération de modèles audio nécessitera plusieurs avancées algorithmiques dans différents domaines, notamment les architectures de diffusion en continu, les codecs, la modélisation des contextes longs et l’inférence sur appareil. Nous avons hâte de partager nos progrès.
Découvrez nos travaux sur l’IA vocale sur cartesia.ai/sonic. Si vous souhaitez travailler avec nous, contactez-nous.
