Blog / Actualités

Découvrez Ink-2 :Le STT classé n° 1 conçu pour les agents vocaux

Eli Pugh 

Nous lançons Ink-2, un modèle de transcription audio conçu pour les agents vocaux en temps réel.

En juin 2026, il se classe premier sur le classement de transcription en continu d’Artificial Analysis pour le plus faible taux d’erreur sur les mots. Il intègre la détection de tours de parole la plus précise de tous les fournisseurs, pour savoir exactement quand écouter et quand répondre.

Taux d’erreur sur les mots : transcription finale par jeu de données

Pourcentage de mots mal transcrits à la finalisation, après détection de la fin de parole. Plus faible = meilleur.

Artificial AnalysisJuin 2026
AA-AgentTalkVoxPopuliEarnings22
3.4%
2.4%
5.3%
Ink-2 (fins sémantiques)
Cartesia
2.8%
2.3%
6.4%
Scribe v2 Realtime
ElevenLabs
3.6%
2.1%
7.2%
U3.5 Pro Realtime
AssemblyAI
6.7%
4.9%
11.4%
Flux
Deepgram
Ink-2 (fins sémantiques)
Cartesia
3.4%
2.4%
5.3%
Scribe v2 Realtime
ElevenLabs
2.8%
2.3%
6.4%
U3.5 Pro Realtime
AssemblyAI
3.6%
2.1%
7.2%
Flux
Deepgram
6.7%
4.9%
11.4%

Pour les agents vocaux, la transcription doit réussir sur trois plans : exactitude, détection des tours et latence. Si l’un échoue, l’expérience se dégrade. L’agent peut mal comprendre l’utilisateur, l’interrompre au mauvais moment, répondre trop lentement ou rendre la conversation peu naturelle. Ink-2 a été conçu pour exceller sur ces trois plans.

Exactitude : transcrire chaque mot correctement

Nous avons beaucoup travaillé sur la reconnaissance d’entités structurées comme les numéros de téléphone, adresses e-mail, séquences alphanumériques et dates. Ink-2 comprend qu’une entité est incomplète et attend la séquence entière avant de confirmer le résultat, sans instruction spéciale.

Nous avons conçu Ink-2 pour différents accents, comme ceux des appels réels aux agents vocaux. Sur AppTek, un test couvrant 14 accents anglais dans de vrais dialogues de centres d’appels, Ink-2 est le meilleur fournisseur STT en continu avec 8 % de WER, contre 10 % pour Deepgram Flux et 12 % pour ElevenLabs Scribe v2.

Taux d’erreur sur les mots (WER) : AppTek

Test de 14 accents anglais sur de vrais dialogues de centres d’appels. Plus faible = meilleur.

8%
Ink-2
Cartesia
10%
Flux
Deepgram
12%
Scribe v2 Realtime
ElevenLabs
13%
U3.5 Pro Realtime
AssemblyAI

L’exactitude se maintient en production, pas seulement sur un audio de référence propre. Notre test interne prélève directement des extraits d’appels réels d’agents vocaux, avec des anglophones non natifs, du bruit de fond et un audio dégradé par de mauvaises conditions réseau. Ink-2 atteint 6,5 % de WER, contre 9,2 % pour ElevenLabs Scribe v2 et 9,4 % pour Deepgram Flux.

Taux d’erreur sur les mots (WER) : agents en production

Test interne de 36 appels réels avec nos agents, enregistrés en production. Plus faible = meilleur.

Évaluation de CartesiaJuillet 2026
6.5%
Ink-2
Cartesia
9.2%
Scribe v2 Realtime
ElevenLabs
9.4%
Flux
Deepgram
10.7%
U3.5 Pro Realtime
AssemblyAI

Les entités structurées et l’audio de production réel mettent véritablement l’exactitude à l’épreuve dans un agent en direct, au-delà d’un test propre. Les démonstrations conservent leurs enregistrements et transcriptions dans la langue originale.

ink-2

Numéro complet et formaté

Transcrit les dix chiffres et les formate comme un numéro de téléphone.

flux-general-en

Omet le dernier chiffre

Écrit le numéro en toutes lettres et perd le dernier chiffre.

Détection des tours : savoir quand écouter et répondre

L’exactitude apparaît clairement dans les tests, mais la détection des tours est le point où la plupart des agents vocaux échouent en production.

La plupart décident qu’un tour est terminé en se fondant sur le silence. Une pause assez longue ferme brusquement le tour. Cela fonctionne en test, mais dans un vrai appel, cela peut couper un client au milieu d’une adresse ou intervenir juste après “et mon e-mail est…”.

Nous avons créé Ink-2 avec une détection sémantique de fin de tour intégrée. Le modèle interprète le sens, plutôt que le silence, pour décider de la fin d’un tour. Il reconnaît une adresse encore incomplète ou une pensée inachevée. Le tour reste ouvert jusqu’à ce qu’il estime avec confiance que le locuteur a terminé.

Ink-2 émet nativement trois événements, sans VAD externe :

  • turn.start : l’utilisateur a commencé à parler.
  • turn.eager_end : le modèle prévoit que le tour se termine ; votre LLM peut commencer à générer en avance.
  • turn.end : la fin du tour est confirmée.

ink-2

Tours de parole : 1

A conservé tout le segment dans un seul tour de parole

flux-general-en

Tours de parole : 2

A découpé un segment en plusieurs tours de parole

scribe_v2_realtime

Tours de parole : 3

A découpé un segment en plusieurs tours de parole

Nous mesurons la détection des tours par rapport à une référence annotée par des humains. La précision indique à quelle fréquence le modèle a raison lorsqu’il annonce la fin d’un tour ; une faible précision coupe la parole. Le rappel indique sa capacité à détecter toutes les vraies fins de tour ; un faible rappel crée des silences gênants pendant qu’il continue d’écouter. F1 équilibre les deux en un score.

Ink-2 maintient à la fois une précision et un rappel élevés, tandis que les alternatives sacrifient l’un pour l’autre.

Détection de fin de tour : agents en production

Test interne d’appels réels d’agents vocaux en production. Plus élevé = meilleur.

Évaluation de CartesiaJuillet 2026
PrécisionRappelF1
89%
97%
93%
Ink-2
Cartesia
80%
97%
88%
Flux
Deepgram
74%
97%
84%
U3.5 Pro Realtime
AssemblyAI
89%
87%
88%
Scribe v2 Realtime
ElevenLabs
Ink-2
Cartesia
89%
97%
93%
Flux
Deepgram
80%
97%
88%
U3.5 Pro Realtime
AssemblyAI
74%
97%
84%
Scribe v2 Realtime
ElevenLabs
89%
87%
88%

Chez micro1, nous utilisons Ink-2 pour Zara, notre agent de recrutement qui mène des entretiens vocaux à grande échelle. La réponse est presque instantanée et la gestion des tours suit très bien les vrais rythmes de conversation.

Aruj MahajanIA chez micro1

Latence : maintenir le rythme de la conversation

Comme la latence de synthèse vocale, celle de la transcription affecte directement le naturel d’une conversation. Nous mesurons le temps jusqu’à la transcription finale, ou TTFT : le délai entre la fin de parole de l’utilisateur et l’arrivée du texte final. C’est ce qui détermine si l’agent paraît attentif ou semble attendre un chargement.

Ink-2 est très rapide, avec un TTFT de 0,1 s. Et puisque turn.eager_end permet à votre LLM de prendre de l’avance avant confirmation de la fin du tour, l’agent répond assez vite pour donner l’impression de participer réellement à la conversation.

ink-2

10.1 s plus tôt

Votre agent peut répondre avant même que le concurrent ne commence

flux-general-en

15.9s

Ce n'est qu'à cet instant que l'agent sait que son interlocuteur a terminé. Il part de zéro.

Rejoignez les équipes qui utilisent Ink-2

ServiceNow
HeyGen
Micro1
Synthesia

Ink-2 est disponible sur play.cartesia.ai, directement par API et sur les plateformes utilisées par les équipes vocales, notamment LiveKit, Vapi et Pipecat.

Nous poursuivons ce travail avec les équipes qui font avancer l’IA vocale et utilisent Ink-2 en production. Nous avons déjà publié un modèle anglais de premier plan. Le multilingue arrive pour adapter Ink-2 à la façon dont parlent vos utilisateurs, où qu’ils soient.

Essayez Ink-2

Cliquez ou appuyez sur Space pour lancer une transcription
Appuyez pour lancer une transcription
Besoin d'un sujet ?
Comment aimez-vous passer vos dimanches ?

Testez Ink-2 dès aujourd'hui

Essayer Cartesia (Anglais)