Nous présentons aujourd’hui Ink, une nouvelle famille de modèles de transcription audio en continu, ou STT, pour les développeurs d’applications vocales en temps réel. Notre premier modèle est Ink-Whisper, une variante de Whisper d’OpenAI spécialement optimisée pour la transcription à faible latence dans les conversations. Disponible dès aujourd’hui, Ink-Whisper est le modèle STT le plus rapide et le plus abordable, conçu pour les agents vocaux d’entreprise.
De Sonic à Ink : de la voix en sortie à la voix en entrée
Avec Sonic, nous sommes devenus le fournisseur de synthèse vocale privilégié des développeurs qui donnent la priorité à la vitesse, à la qualité et à la fiabilité. Cela n’a rien de surprenant, compte tenu de l’avance de Sonic en matière de très faible latence, qui permet à nos clients de créer des expériences vocales interactives très réalistes. Avec Ink, nous nous tournons désormais vers l’autre côté de la conversation, la transcription audio.
Repenser Whisper pour le temps réel
Pour notre lancement STT, nous avons étudié les outils déjà utilisés par les développeurs et leurs problèmes éventuels. Cela nous a conduits à whisper-large-v3-turbo d’OpenAI. Whisper est largement utilisé pour de bonnes raisons. Sa précision de transcription conversationnelle est comparable à celle d’autres fournisseurs propriétaires, il est open source et son inférence peut être efficace.
La plupart des innovations autour de Whisper ont cherché à améliorer le débit, c’est-à-dire la vitesse de transcription de grands ensembles de données, mesurée par le facteur temps réel ou RTF. C’est utile pour le post-traitement de longs fichiers audio. Mais Whisper standard manque de vitesse et de précision pour les agents vocaux en temps réel, où la qualité de transcription doit être élevée pour chaque appel, pas seulement en moyenne. De plus, il n’a pas été conçu pour les conditions difficiles du monde réel.
Whisper a été conçu pour le traitement par lots plutôt que pour le dialogue en direct. Nous avons donc revu son architecture pour créer Ink-Whisper, pensé pour l’IA vocale en temps réel, avec la vitesse et les conditions réelles au cœur de sa conception.
Ink-Whisper est conçu pour les conversations réelles
Dans les usages professionnels, les agents vocaux doivent transcrire la parole au moment où elle est prononcée, de façon fiable dans des environnements très variés. Nous avons construit Ink-Whisper en nous concentrant sur la précision dans les conditions qui posent généralement problème aux systèmes STT standard :
- Artefacts téléphoniques : l’audio compressé à faible bande passante ajoute de la distorsion.
- Noms propres et termes spécialisés : noms de produits, médicaments ou instruments financiers exigent de la clarté.
- Bruit de fond : circulation, conversations au restaurant, pleurs de bébé et parasites compliquent une transcription nette.
- Disfluences et silences : les hésitations comme “euh” et les pauses déroutent les implémentations standard de Whisper.
- Accents et variations : les voix sont diverses et les modèles STT doivent s’adapter.
Le découpage dynamique est l’une de nos principales améliorations par rapport à Whisper standard. Celui-ci fonctionne mieux sur des segments complets de 30 secondes. L’IA conversationnelle traite pourtant des segments bien plus courts et fragmentés. Nous avons modifié Whisper pour gérer des segments de longueur variable qui se terminent à des points sémantiquement pertinents. Cela réduit les erreurs et les hallucinations, notamment pendant les silences ou les interruptions audio.
Pour vérifier qu’Ink-Whisper fonctionne mieux en conditions réelles, nous avons créé un ensemble de jeux d’évaluation reflétant ces difficultés fréquentes de l’IA vocale :
- Jeu de bruit de fond : conversations enregistrées dans des environnements bruyants, circulation, cafés ou bureaux.
- Jeu de noms propres : 100 échantillons de SPGISpeech riches en termes financiers et noms de marques.
- Jeu d’accents : transcriptions couvrant différents accents anglais pour tester la fiabilité entre groupes démographiques.
Sur ces jeux de données, Ink-Whisper dépasse whisper-large-v3-turbo de référence en précision mesurée par le taux d’erreur sur les mots, ou WER. Son WER est aussi compétitif face aux autres modèles STT en continu. Surtout, il est optimisé pour des performances en temps réel adaptées à la production :
| Taux d’erreur sur les mots selon les jeux de données | Détails du jeu de données | Cartesia Streaming whisper-natural | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | Assembly Streaming |
|---|---|---|---|---|---|
| Appels téléphoniques | Conversations naturelles au téléphone | 0.19 | 0.18 | 0.28 | 0.23 |
| Noms propres | Parole riche en jargon | 0.065 | 0.045 | 0.071 | 0.044 |
| Bruits de fond | Bruit de fond | 0.033 | 0.038 | 0.099 | 0.027 |
| Disfluences | Hésitations et bruit | 0.064 | 0.055 | 0.156 | 0.137 |
| Sous-ensemble Speech Accent Archive | Accents variés | 0.015 | 0.024 | 0.014 | 0.016 |
Ink-Whisper est le modèle en continu le plus rapide
Au-delà de la précision, la transcription en continu doit être très rapide pour permettre une conversation réaliste. Avec Ink-Whisper, nous mettons l’accent sur une nouvelle mesure, le temps jusqu’à la transcription complète, ou TTCT. Il mesure le délai nécessaire pour disposer de toute la transcription après que l’utilisateur a cessé de parler. Le TTCT détermine la vitesse de réponse de l’ensemble du système, à la manière d’une personne attentive qui écoute en direct.
Le retard d’une réponse trahit immédiatement un robot peu naturel. Ces retards brisent le rythme de la conversation. Ils provoquent des appels interrompus, de la frustration et des pertes de revenus. Réduire le TTCT au minimum est une question de vitesse, mais vise surtout à rendre l’interaction humaine.
Ink-Whisper dépasse whisper-large-v3-turbo de référence sur le TTCT. Il offre même le TTCT le plus rapide de tous les modèles STT en continu que nous avons testés :
| Temps jusqu’à la transcription complète après l’envoi du dernier audio | Cartesia Streaming Ink-Whisper | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | AssemblyAI Universal Streaming |
|---|---|---|---|---|
| Médiane (ms) | 66 | 74 | 70 | 737 |
| P90 (ms) | 98 | 109 | 189 | 829 |
Whisper standard reste l’un des modèles STT ouverts les plus polyvalents, mais il n’a pas été conçu pour le temps réel. Ink-Whisper change cela grâce à des optimisations de précision conversationnelle et de très faible latence. Il fournit le TTCT le plus rapide que nous ayons observé, avec de bonnes performances sur la parole bruitée, accentuée et variable. Nous l’avons évalué dans les conditions réelles rencontrées par les agents vocaux, et non dans l’environnement contrôlé d’un laboratoire ou d’un studio.
Ink-Whisper est le modèle en continu le plus abordable
Nous croyons que l’avenir passe par la voix et concrétisons cette conviction en rendant Ink-Whisper accessible aux développeurs de solutions vocales. Ink-Whisper est à la fois le modèle STT en continu le plus rapide et le plus abordable disponible. À seulement 1 crédit par seconde, soit 0,13 $ par heure avec notre abonnement Scale, il offre une transcription en temps réel de premier plan au prix le plus bas.
Pour démarrer avec Ink-Whisper :
- Ink-Whisper s’intègre facilement à Vapi, Pipecat et LiveKit, pour lancer des interactions vocales en continu en quelques minutes.
- Avec 99,9 % de disponibilité et une conformité de niveau entreprise, SOC 2 Type II, HIPAA et PCI, vous pouvez déployer à grande échelle en confiance.
Commencez ici ou consultez la documentation.
L’avenir de l’IA vocale avec Cartesia
La demande d’agents vocaux augmente fortement. Les plus efficaces reposent sur une IA audio de pointe comme notre modèle de synthèse vocale Sonic. Avec Ink-Whisper, nous répondons désormais à cette demande de l’autre côté de la conversation, pour permettre des échanges rapides et naturels. Ce lancement donne un premier aperçu de notre refonte de la pile vocale en temps réel. La suite arrive.
