Ink : le modèle de reconnaissance vocale le plus rapide et le plus précis

Classé numéro 1 pour la précision, conçu pour les agents vocaux avec détection sémantique des fins de tour et une latence parmi les meilleures du secteur.
Cliquez ou appuyez sur Space pour lancer une transcription
Appuyez pour lancer une transcription
Besoin d'un sujet ?
À quel loisir vous êtes-vous mis récemment ?

Un modèle de transcription pour tous les environnements où votre entreprise exerce ses activités

Les trains grondent et les annonces crépitent. Ink-2 transcrit chaque mot de l'interlocuteur.

Ville bruyante

Illustration d'une scène de rue en Matin
Illustration d'une scène de rue en Midi
Illustration d'une scène de rue en Nuit
Illustration d'une scène de rue en Matin

Conçu pour les agents vocaux

Quatre capacités qui font d'Ink la couche de transcription sur laquelle reposent les agents en production.

Précision

Bien entendu dès la première fois.

En pratique

Dans un agent vocal, la transcription est la base de tout le reste. Une erreur de transcription fausse l'entrée du LLM et oriente l'échange dans la mauvaise direction.

L'inverse est tout aussi vrai. La précision améliore toute la chaîne : une transcription fidèle produit une meilleure réponse et un appel qui aboutit.


L'approche d'Ink-2

Ink affiche le taux d'erreur de mots (WER) le plus bas parmi les modèles de transcription en streaming et traite nativement les données structurées : numéros de téléphone, dates, e-mails, devises et UUID. Il est conçu pour les conditions audio réelles, dont la téléphonie, le bruit de fond et les accents variés.

Dates, codes alphanumériques, identifiants

Fluidité de la conversation

Sait quand vous commencez et quand vous terminez.

En pratique

Une conversation comporte deux moments déterminants : quand l'appelant commence à parler et quand il termine. Si l'agent manque le début, il manque tout le tour de parole. S'il détecte la fin trop tôt, il coupe la réflexion de l'appelant. Le bon modèle de transcription reconnaît les deux sans attendre.


L'approche d'Ink-2

Ink-2 intègre la détection des tours de parole. Le modèle signale directement turn.start et turn.end, sans détecteur d'activité vocale externe à intégrer ni à maintenir. Pour réduire la latence, turn.eager_end permet au LLM de commencer avant la confirmation de la fin du tour.

La détection sémantique détermine la fin du tour selon le sens plutôt que le silence. Une pause au milieu d'une réflexion ne déclenche donc pas l'agent trop tôt.

ink-2

10.1 s plus tôt

Votre agent peut répondre avant même que le concurrent ne commence

flux-general-en

15.9s

Ce n'est qu'à cet instant que l'agent sait que son interlocuteur a terminé. Il part de zéro.

Vitesse

L'appelant cesse de parler.
L'agent commence à réfléchir.

En pratique

Quand la transcription est rapide et régulière, la réponse de l'agent paraît immédiate. Une transcription lente sur dix suffit à rompre cette impression sur un appel sur dix. Neuf bons appels ne compensent pas celui qui s'est mal passé.


L'approche d'Ink-2

Ink est le modèle de reconnaissance vocale en streaming le plus rapide. Il repose sur un moteur d'inférence conçu pour la conversation en temps réel. La transcription finale arrive en 0,1 s et turn.eager_end réduit le délai entre le dernier mot et la première réponse.

Ink
88ms
Un clignement d'œil
100ms
Seuil de réponse humaine
150ms

Coût

Une qualité qui ne coûte pas plus cher quand vous grandissez.

En pratique

La voix est l'interface de communication la plus naturelle. Maîtriser le coût et la qualité à grande échelle permet de la rendre omniprésente, comme interface par défaut de chaque interaction avec un agent.


L'approche d'Ink-2

L'architecture à modèles d'espace d'état d'Ink offre un débit 10 à 100 fois supérieur à celui des transformers. Le coût de calcul baisse à grande échelle, sans compromis sur la qualité. L'optimisation continue de nos modèles améliore les coûts unitaires à mesure que votre utilisation augmente.

Une sécurité de niveau entreprise.Du cloud au local.

  • Badge Conforme à HIPAA

    Conforme à HIPAA

  • Badge SOC 2 Type 2

    SOC 2 Type 2

  • Badge RGPD (GDPR)

    RGPD (GDPR)

  • Badge PCI

    PCI

FAQ

Pourquoi Ink-2 est-il le meilleur modèle de reconnaissance vocale pour les agents ?

Ink-2 est le modèle de reconnaissance vocale en streaming de Cartesia, conçu pour les agents vocaux en production. Comme notre synthèse vocale, il repose sur l'architecture des modèles à espace d'états, développée par notre équipe fondatrice à Stanford. Cette architecture permet à Ink-2 d'offrir trois avantages simultanément :

Le taux d'erreur sur les mots le plus bas parmi les modèles de transcription en streaming. Ink-2 surpasse Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro, ElevenLabs Scribe-2-realtime et d'autres modèles de production sur les enregistrements téléphoniques, les accents, les environnements bruyants et les conférences de résultats financiers, y compris pour les numéros de téléphone, e-mails et UUID.

Une détection des tours de parole de premier plan, intégrée au modèle. Vous n'avez pas besoin d'un modèle séparé comme Silero : moins de dépendances, moins de latence et une gestion des tours plus précise.

Une résistance au bruit intégrée. Ink-2 gère le bruit de fond sans Krisp ni autre filtre audio, ce qui réduit le coût et la latence de votre système.

Ai-je encore besoin de Krisp ou de Silero avec Ink-2 ?

Non. C'est l'une des principales raisons pour lesquelles les équipes passent à Ink-2 :

La gestion des tours de parole est intégrée. La plupart des modèles de reconnaissance vocale ont besoin d'un détecteur externe, comme Silero, pour savoir quand l'utilisateur a terminé. Ink-2 le fait nativement, plus vite et plus précisément qu'avec un modèle séparé.

La résistance au bruit est intégrée. La plupart des agents vocaux ajoutent Krisp ou un filtre similaire à leur reconnaissance vocale pour supprimer le bruit de fond, ce qui augmente le coût, la latence et la complexité. Ink-2 résiste au bruit dès sa mise en service.

Moins de modèles signifie moins de latence, moins de coût et moins de points de défaillance.

Ink-2 peut-il fonctionner sur site ou dans mon cloud privé ?

Oui, Ink-2 peut être déployé :

Sur site, dans votre centre de données, y compris dans un environnement isolé du réseau

Dans votre VPC sur AWS, GCP ou Azure

Sous licence OEM pour l'intégrer directement à votre produit

Ink-2 convient ainsi aux marchés publics, aux secteurs réglementés comme la santé, la finance et l'assurance, ainsi qu'aux clients soumis à des exigences de souveraineté ou de résidence des données. Les déploiements sur site et OEM sont disponibles sous contrat entreprise.

Quelles langues Ink-2 prend-il en charge ?

Ink-2 prend en charge l'anglais, l'espagnol, le français, l'hindi et le japonais.

Combien coûte Ink-2 ?

Ink-2 coûte 3 crédits par seconde. Les détails tarifaires et les remises sur volume figurent sur https://www.cartesia.ai/pricing. Les contrats Enterprise proposent une tarification personnalisée selon l'utilisation et le mode de déploiement.

Cartesia propose aussi un programme d'aide aux startups sur https://www.cartesia.ai/startups, avec des crédits pour les jeunes entreprises admissibles.

Quand contacter l'équipe commerciale ?

Contactez l'équipe Cartesia dans les cas suivants :

Vous exécutez des charges de production importantes, supérieures à 50 millions de crédits

Vous avez besoin d'un déploiement sur site, en VPC ou sous licence OEM

Vous avez besoin d'un BAA, de l'absence de conservation des données ou d'engagements contractuels de conformité pour la santé, la finance ou un secteur réglementé

Vous travaillez dans les achats publics ou gouvernementaux

Pour les autres usages, comme l'évaluation, le prototypage et les petites charges de production, les offres en libre-service et la documentation technique sur https://docs.cartesia.ai/build-with-cartesia/stt-models/latest vous permettent de démarrer.

Commencer aujourd'hui

Parlez à un expert.

Échangez avec notre équipe et découvrez comment Cartesia peut vous aider à créer des expériences vocales de premier plan.

Contacter les ventes

Commencez à développer.

Accédez à nos modèles via l'API et mettez un agent vocal en production en quelques minutes.

Essayer Cartesia