Nous lançons Ink-2, un modèle de transcription audio conçu pour les agents vocaux en temps réel.
En juin 2026, il se classe premier sur le classement de transcription en continu d’Artificial Analysis pour le plus faible taux d’erreur sur les mots. Il intègre la détection de tours de parole la plus précise de tous les fournisseurs, pour savoir exactement quand écouter et quand répondre.
Taux d’erreur sur les mots : transcription finale par jeu de données
Pourcentage de mots mal transcrits à la finalisation, après détection de la fin de parole. Plus faible = meilleur.
Pour les agents vocaux, la transcription doit réussir sur trois plans : exactitude, détection des tours et latence. Si l’un échoue, l’expérience se dégrade. L’agent peut mal comprendre l’utilisateur, l’interrompre au mauvais moment, répondre trop lentement ou rendre la conversation peu naturelle. Ink-2 a été conçu pour exceller sur ces trois plans.
Exactitude : transcrire chaque mot correctement
Nous avons beaucoup travaillé sur la reconnaissance d’entités structurées comme les numéros de téléphone, adresses e-mail, séquences alphanumériques et dates. Ink-2 comprend qu’une entité est incomplète et attend la séquence entière avant de confirmer le résultat, sans instruction spéciale.
Nous avons conçu Ink-2 pour différents accents, comme ceux des appels réels aux agents vocaux. Sur AppTek, un test couvrant 14 accents anglais dans de vrais dialogues de centres d’appels, Ink-2 est le meilleur fournisseur STT en continu avec 8 % de WER, contre 10 % pour Deepgram Flux et 12 % pour ElevenLabs Scribe v2.
Taux d’erreur sur les mots (WER) : AppTek
Test de 14 accents anglais sur de vrais dialogues de centres d’appels. Plus faible = meilleur.
L’exactitude se maintient en production, pas seulement sur un audio de référence propre. Notre test interne prélève directement des extraits d’appels réels d’agents vocaux, avec des anglophones non natifs, du bruit de fond et un audio dégradé par de mauvaises conditions réseau. Ink-2 atteint 6,5 % de WER, contre 9,2 % pour ElevenLabs Scribe v2 et 9,4 % pour Deepgram Flux.
Taux d’erreur sur les mots (WER) : agents en production
Test interne de 36 appels réels avec nos agents, enregistrés en production. Plus faible = meilleur.
Les entités structurées et l’audio de production réel mettent véritablement l’exactitude à l’épreuve dans un agent en direct, au-delà d’un test propre. Les démonstrations conservent leurs enregistrements et transcriptions dans la langue originale.
ink-2
Numéro complet et formaté
Transcrit les dix chiffres et les formate comme un numéro de téléphone.
flux-general-en
Omet le dernier chiffre
Écrit le numéro en toutes lettres et perd le dernier chiffre.
Détection des tours : savoir quand écouter et répondre
L’exactitude apparaît clairement dans les tests, mais la détection des tours est le point où la plupart des agents vocaux échouent en production.
La plupart décident qu’un tour est terminé en se fondant sur le silence. Une pause assez longue ferme brusquement le tour. Cela fonctionne en test, mais dans un vrai appel, cela peut couper un client au milieu d’une adresse ou intervenir juste après “et mon e-mail est…”.
Nous avons créé Ink-2 avec une détection sémantique de fin de tour intégrée. Le modèle interprète le sens, plutôt que le silence, pour décider de la fin d’un tour. Il reconnaît une adresse encore incomplète ou une pensée inachevée. Le tour reste ouvert jusqu’à ce qu’il estime avec confiance que le locuteur a terminé.
Ink-2 émet nativement trois événements, sans VAD externe :
turn.start: l’utilisateur a commencé à parler.turn.eager_end: le modèle prévoit que le tour se termine ; votre LLM peut commencer à générer en avance.turn.end: la fin du tour est confirmée.
ink-2
Tours de parole : 1
A conservé tout le segment dans un seul tour de parole
flux-general-en
Tours de parole : 2
A découpé un segment en plusieurs tours de parole
scribe_v2_realtime
Tours de parole : 3
A découpé un segment en plusieurs tours de parole
Nous mesurons la détection des tours par rapport à une référence annotée par des humains. La précision indique à quelle fréquence le modèle a raison lorsqu’il annonce la fin d’un tour ; une faible précision coupe la parole. Le rappel indique sa capacité à détecter toutes les vraies fins de tour ; un faible rappel crée des silences gênants pendant qu’il continue d’écouter. F1 équilibre les deux en un score.
Ink-2 maintient à la fois une précision et un rappel élevés, tandis que les alternatives sacrifient l’un pour l’autre.
Détection de fin de tour : agents en production
Test interne d’appels réels d’agents vocaux en production. Plus élevé = meilleur.
Chez micro1, nous utilisons Ink-2 pour Zara, notre agent de recrutement qui mène des entretiens vocaux à grande échelle. La réponse est presque instantanée et la gestion des tours suit très bien les vrais rythmes de conversation.
Latence : maintenir le rythme de la conversation
Comme la latence de synthèse vocale, celle de la transcription affecte directement le naturel d’une conversation. Nous mesurons le temps jusqu’à la transcription finale, ou TTFT : le délai entre la fin de parole de l’utilisateur et l’arrivée du texte final. C’est ce qui détermine si l’agent paraît attentif ou semble attendre un chargement.
Ink-2 est très rapide, avec un TTFT de 0,1 s. Et puisque turn.eager_end permet à votre LLM de prendre de l’avance avant confirmation de la fin du tour, l’agent répond assez vite pour donner l’impression de participer réellement à la conversation.
ink-2
Votre agent peut répondre avant même que le concurrent ne commence
flux-general-en
Ce n'est qu'à cet instant que l'agent sait que son interlocuteur a terminé. Il part de zéro.
Rejoignez les équipes qui utilisent Ink-2
Ink-2 est disponible sur play.cartesia.ai, directement par API et sur les plateformes utilisées par les équipes vocales, notamment LiveKit, Vapi et Pipecat.
Nous poursuivons ce travail avec les équipes qui font avancer l’IA vocale et utilisent Ink-2 en production. Nous avons déjà publié un modèle anglais de premier plan. Le multilingue arrive pour adapter Ink-2 à la façon dont parlent vos utilisateurs, où qu’ils soient.