Schéma présentant le modèle TTS et la voix comme des entrées distinctes

Modèle TTS et voix : deux choses différentes

Un modèle TTS génère de la parole. Mais le modèle et sa voix sont deux choses différentes. Les confondre conduit à de mauvaises décisions de conception en IA vocale.

[Produit]

Une grille de quatre carrés : trois lavis à l'aquarelle vert sauge et gris pâle, et un carré au contour noir

Pourquoi la précision et le rappel comptent autant

L'exactitude semble être la bonne mesure, jusqu'à ce qu'un modèle obtienne 90 % sans rien faire. La précision et le rappel donnent une image plus fidèle, notamment en IA vocale.

[Produit]

Une feuille au contour dessiné à la main recouvre une bulle de parole verte à l'aquarelle marquée 3.6

Découvrez Sonic-3.6

Sonic-3.6 progresse fortement par rapport à Sonic-3.5 en naturel et en qualité. Les auditeurs le préfèrent dans jusqu'à 93 % des comparaisons à l'aveugle sur quinze variantes régionales.

[Produit]

Des noms difficiles à transcrire comme enclomiphene, zuclopenthixol et pityriasis entourent un micro, avec aminophylline nettement lisible à côté

Nouveautés Ink-2 : termes clés et détection configurable des tours

Deux nouveautés Ink-2 : les termes clés améliorent la transcription des entités spécialisées et la détection configurable des tours ajuste la fin de tour pour la vitesse ou la précision.

[Produit]

Ce modèle TTS est-il bon ?

Ce modèle TTS est-il bon ?

Pourquoi l'évaluation de la synthèse vocale atteint ses limites à mesure que les modèles progressent, et comment mesurer ce qui compte réellement.

[Recherche]

Une question parlée entre en spirale, mot par mot, dans un micro, évoquant la transcription audio

Découvrez Ink-2 : le STT classé n° 1 conçu pour les agents vocaux

Découvrez Ink-2, notre modèle de transcription audio pour les agents vocaux en temps réel, premier du classement en continu d'Artificial Analysis, avec la détection intégrée des tours la plus précise.

[Actualités]

Rosace de pétales verts translucides superposés, traversée en son centre par trois cercles

Guide pour choisir des modèles d'IA vocale

Une méthode concrète pour évaluer les modèles ASR, TTS et de détection des tours de parole selon votre usage réel, au-delà du laboratoire.

[Produit]

Six études à l'aquarelle verte, associant chacune des aplats peints à un rectangle dessiné à la main selon une disposition différente

Guide de la terminologie de l'IA vocale pour débuter

Un glossaire en langage clair des 20 termes essentiels pour comprendre, évaluer et créer une IA vocale conversationnelle.

[Produit]

Des lignes sombres parallèles traversent une bande verte peinte, se croisent au centre puis poursuivent leur chemin

Mamba-3 : un modèle à espace d'états conçu pour l'inférence

Mamba-3 recentre les modèles à espace d'états sur les charges d'inférence modernes, améliore la qualité et conserve la faible latence qui fait l'intérêt des modèles linéaires.

[Recherche]

Quatre exemplaires d'un même glyphe en boucle, alignés en vert pâle, vert moyen, gris et vert foncé

Cartesia recrute un ingénieur logiciel pour lever une armée de Claude

Écrire du code semble résolu. L'ingénierie ne l'est pas. Nous recrutons pour combler cet écart.

[Ingénierie]

Le nom Cartesia au-dessus des mots indiquant la conformité au RGPD, à côté d'un cercle d'étoiles ambrées de l'Union européenne

Cartesia se conforme au RGPD

La plateforme de synthèse vocale de Cartesia est désormais conforme au RGPD, confirmant notre engagement pour la protection des données, la vie privée et une IA responsable centrée sur l'humain.

[Actualités]

Plusieurs carrés verts translucides à l'aquarelle, superposés et légèrement inclinés, dont les recouvrements s'assombrissent vers le centre

Découvrez Line : la plateforme moderne de développement d'agents vocaux

Découvrez Line de Cartesia, la plateforme moderne de développement d'agents vocaux. Line place le code au premier plan, car les meilleurs produits se construisent avec du code.

[Produit]

Trois rangées de blocs à l'aquarelle verte et aux contours dessinés à la main, plus larges et foncés en haut, plus étroits et pâles en bas

Modélisation hiérarchique

Découvrez H-Net, des architectures hiérarchiques qui apprennent directement à partir de données brutes en regroupant les entrées en concepts de niveau supérieur, au-delà des limites de la tokenisation.

[Recherche]

Découvrez Ink : des modèles de transcription audio pour les conversations en temps réel

Découvrez Ink : des modèles de transcription audio pour les conversations en temps réel

Nous présentons Ink, une nouvelle famille de modèles de transcription audio en continu pour les développeurs d'applications vocales en temps réel. Ink-Whisper est le modèle de transcription le plus rapide et le plus abordable, conçu pour les agents vocaux d'entreprise.

[Produit]

Découvrez Organisations et Tableaux de bord

Découvrez Organisations et Tableaux de bord

Nous construisons Cartesia pour les développeurs qui déploient l'IA vocale à grande échelle. Aujourd'hui, nous présentons deux fonctions pour faciliter la collaboration et le suivi : Organisations et Tableaux de bord.

[Produit]

Découvrez le clonage vocal professionnel

Découvrez le clonage vocal professionnel

Découvrez le clonage vocal professionnel (PVC), professional-quality voice clones trained on Sonic, now available on Startup+ plans.

[Produit]

SDK Python de Cartesia v2.0.0

SDK Python de Cartesia v2.0.0

Nous annonçons la version 2.0.0 de notre SDK Python, qui améliore l'expérience des développeurs utilisant les fonctions vocales d'IA de Cartesia avec Python.

[Ingénierie]

Cartesia rejoint la septième édition de l'Enterprise Tech 30 de Wing Venture Capital

Cartesia rejoint la septième édition de l'Enterprise Tech 30 de Wing Venture Capital

Cartesia, un fournisseur majeur de modèles audio génératifs, annonce aujourd'hui sa sélection pour la septième édition de l'Enterprise Tech 30, une liste de référence des entreprises technologiques privées les plus prometteuses pour les professionnels, à tous les stades de développement.

[Actualités]

Notre série A et l'avenir de l'IA vocale

Notre série A et l'avenir de l'IA vocale

Nous annonçons une série A de 64 millions de dollars menée par Kleiner Perkins. Ce financement nous aidera à agrandir notre équipe et à investir dans la recherche pour construire la prochaine génération de modèles.

[Actualités]

Llamba : développer les modèles récurrents distillés pour un traitement efficace du langage

Llamba : développer les modèles récurrents distillés pour un traitement efficace du langage

Les prochaines années ouvriront une nouvelle ère de l'IA sur appareil. Les modèles embarqués alimenteront un large éventail d'applications.

[Recherche]

Comment créer un agent vocal IA avec Cartesia

Comment créer un agent vocal IA avec Cartesia

Un guide étape par étape pour créer un agent vocal IA naturel à faible latence avec Sonic de Cartesia, de l'architecture au déploiement en production.

[Ingénierie]

L'état de l'IA vocale en 2024

L'état de l'IA vocale en 2024

Notre premier rapport sur l'état de l'IA vocale en 2024 présente les avancées majeures de l'infrastructure, les nouveaux usages qui font progresser le secteur et les perspectives pour 2025.

[Recherche]

Notre levée d'amorçage

Notre levée d'amorçage

Nous annonçons une levée d'amorçage de 27 millions de dollars menée par Index Ventures, avec Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel et 90 investisseurs providentiels.

[Actualités]

La saison des hackathons chez Cartesia

La saison des hackathons chez Cartesia

Octobre 2024 a été un mois chargé chez Cartesia. Nous avons réuni plus de 2 000 développeurs à San Francisco et distribué 20 000 $ de prix aux idées les plus innovantes créées avec Sonic.

[Ingénierie]

Découvrez Voice Changer : transformez l’audio à votre façon

Découvrez Voice Changer : transformez l’audio à votre façon

Voice Changer transforme la voix de tout clip audio tout en conservant son interprétation, son émotion et sa prosodie, avec des voix ou des clones de qualité studio.

[Produit]

Huit nouvelles langues arrivent dans Sonic Multilingual

Huit nouvelles langues arrivent dans Sonic Multilingual

Aujourd'hui, nous annonçons la version alpha de huit nouvelles langues dans Sonic Multilingual : hindi, italien, coréen, néerlandais, polonais, russe, suédois et turc.

[Produit]

Nouvelles avancées de l'intelligence sur appareil

Nouvelles avancées de l'intelligence sur appareil

Chez Cartesia, notre mission est de construire la prochaine génération d'IA : une intelligence interactive omniprésente qui fonctionne où que vous soyez.

[Recherche]

Découvrez Sonic : un modèle vocal à faible latence pour une parole réaliste

Découvrez Sonic : un modèle vocal à faible latence pour une parole réaliste

Nous lançons aujourd'hui Sonic, notre modèle vocal à faible latence qui génère une parole réaliste.

[Recherche]

Based : des modèles de langage à attention linéaire équilibrent rappel et débit

Based : des modèles de langage à attention linéaire équilibrent rappel et débit

Based traite les prompts 56 % plus vite que FlashAttention-2 et 44 % plus vite que Mamba. Son débit de génération de texte est 24 fois supérieur à celui de FlashAttention-2.

[Recherche]

Mamba-3B-SlimPJ : les modèles à espace d'états rivalisent avec les meilleures architectures Transformer

Mamba-3B-SlimPJ : les modèles à espace d'états rivalisent avec les meilleures architectures Transformer

Nous publions Mamba-3B-SlimPJ, le modèle de langage Mamba le plus performant à ce jour, en partenariat avec Cartesia et Together, sous licence Apache 2.0.

[Recherche]

Commencer aujourd'hui

Parlez à un expert.

Échangez avec notre équipe et découvrez comment Cartesia peut vous aider à créer des expériences vocales de premier plan.

Contacter les ventes

Commencez à développer.

Accédez à nos modèles via l'API et mettez un agent vocal en production en quelques minutes.

Essayer Cartesia