Apprendre

Comparatif des meilleurs modèles de transcription vocale (2026)

Rene 
Comparatif des meilleurs modèles de transcription vocale (2026)

Vous comparez des modèles de transcription parce qu’un problème est apparu en aval : un agent a réservé le mauvais jour, une transcription a déformé un numéro de téléphone, ou un traitement par lots a coûté plus cher que le produit qu’il alimente. Cette page classe les modèles qui comptent en 2026 selon la tâche que vous leur confiez et indique les limites de chacun.

En bref, pour transcrire de l’anglais en direct dans un agent vocal, Ink 2 est le meilleur point de départ. En juin 2026, il occupait la première place du classement de transcription en streaming d’Artificial Analysis pour le taux d’erreur de mots et gérait la détection des tours sans modèle séparé. Pour le streaming multilingue, Deepgram Nova-3 et les modèles Universal d’AssemblyAI couvrent aujourd’hui davantage de langues. Pour transcrire des fichiers enregistrés sur du matériel que vous contrôlez, Whisper large-v3 d’OpenAI est la référence open source. Les classements évoluent ; consultez les résultats actuels plutôt que de vous fier à une seule page, y compris celle-ci.

Vue d’ensemble : streaming et traitement par lots répondent à des besoins différents

La première distinction ne sépare pas les fournisseurs, mais deux types de travail :

  • La transcription en streaming, en temps réel, renvoie du texte pendant que la personne parle encore. Les agents vocaux, le sous-titrage en direct et le routage d’appels en ont besoin. Le modèle valide des mots qu’il n’a entendus qu’en partie. On juge donc sa précision, sa latence et sa capacité à reconnaître la fin d’une pensée.
  • La transcription par lots reçoit un enregistrement complet et renvoie une transcription. Elle sert à la postproduction de podcasts, aux comptes rendus de réunion et aux contrôles de conformité. La latence compte beaucoup moins ; la précision et le coût horaire comptent davantage.

Un modèle conçu pour une tâche excelle rarement dans l’autre. Whisper en est l’exemple le plus net : une excellente précision par lots pour un modèle ouvert, mais aucun streaming natif. Choisir sur un classement unique qui mélange ces tâches masque cette différence. Les comparaisons ci-dessous sont donc regroupées par usage.

Comment évaluer un modèle de transcription

Trois critères décident de la plupart des déploiements en temps réel :

  1. La précision, surtout sur les chaînes qui comptent pour votre produit. Le taux d’erreur de mots moyen (WER) masque les erreurs coûteuses. Un modèle peut afficher un WER global honorable tout en déformant les codes de confirmation, les adresses e-mail ou en omettant silencieusement un nombre prononcé. Ce sont précisément les erreurs qui cassent le parcours de réservation d’un agent. Nous détaillons ce problème dans notre guide du taux d’erreur de mots : le WER est un diagnostic, pas un verdict, car il dépend de la transcription de référence et ne dit rien des erreurs qu’un auditeur pardonne.
  2. La détection des tours de parole. Dans une conversation, il faut décider quand l’utilisateur a fini de parler. Beaucoup de systèmes ajoutent un détecteur d’activité vocale et un délai de silence ; cette combinaison se trompe sur les pauses, et chaque modèle ajouté augmente la latence. Les modèles qui prédisent eux-mêmes la fin d’un tour suppriment ce complément.
  3. La latence en conditions réelles. Les fournisseurs annoncent des temps médians sur de l’audio propre. Votre audio contient des accents, des voix qui se chevauchent et du bruit de fond, et vos appelants subissent votre p95. Mesurez le délai jusqu’à la transcription finale sur des enregistrements proches de votre trafic.

Le prix est le quatrième critère, et la réponse honnête est peu spectaculaire : les tarifs à la minute varient de quelques dixièmes de centime, changent souvent et comptent moins qu’un modèle qui comprend vos clients. Consultez les pages tarifaires en vigueur au moment de votre lecture.

Les modèles à comparer

Voici les modèles qu’un développeur rencontrera en sélectionnant des solutions de transcription en 2026. Les affirmations viennent des documents des fournisseurs ou de classements indépendants, et leur origine est indiquée.

Cartesia Ink 2 : l’anglais en streaming pour les agents vocaux

Ink 2 est un modèle de streaming conçu pour les agents en temps réel, et c’est celui que nous développons. Ses points forts, selon l’annonce de lancement et le classement streaming d’Artificial Analysis, dont il occupait la première place pour le taux d’erreur de mots en juin 2026 :

  • Précision sur l’audio de production : enregistrements téléphoniques, accents variés, bruit et présentations de résultats financiers. Dans ces tests, il devance Deepgram Flux, Soniox RT-V4, les modèles temps réel d’AssemblyAI et ElevenLabs Scribe-2-realtime. Pour les entités structurées, comme les téléphones, e-mails, UUID et dates, il attend la séquence complète avant de la valider.
  • Détection des tours intégrée : la prédiction de fin de tour fait partie du modèle, sans Silero ni service de gestion des tours séparé. Dans un pipeline Pipecat, les prédictions anticipées de fin de tour d’Ink ont réduit le temps de réponse d’environ une demi-seconde en permettant à l’agent de commencer sa réponse avant la fin formelle du tour de l’utilisateur.
  • Résistance au bruit sans filtre de prétraitement, ce qui supprime une étape comme Krisp, ainsi que son coût et sa latence.

Ses limites actuelles : Ink 2 transcrit uniquement l’anglais, avec un modèle multilingue en préversion. Si vos agents prennent aujourd’hui des appels en espagnol ou en hindi, choisissez une des options multilingues ci-dessous et réévaluez plus tard. Cartesia propose des déploiements cloud, sur site et isolés du réseau, et vous pouvez tester Ink gratuitement dans le Playground.

OpenAI Whisper large-v3 : la référence open source par lots

Whisper est le modèle de référence pour la transcription par lots sur vos propres GPU : poids ouverts, environ 99 langues, bonne précision sur de l’audio propre et aucune dépendance à un fournisseur. Les équipes l’hébergent elles-mêmes pour les charges sensibles à la confidentialité ou au coût.

Son point faible est la tâche qui donne son titre à cette page. Whisper fonctionne uniquement par lots : aucun streaming natif, aucune détection des tours et une tendance connue à inventer des phrases pendant les silences ou les sons non vocaux. C’est le problème signalé dans l’article d’AssemblyAI, dont hérite chaque couche de streaming autour de Whisper. Les systèmes qui découpent l’audio ajoutent environ 500 millisecondes de latence et doivent gérer eux-mêmes la fin de parole. Utilisez Whisper pour les fichiers. N’en faites pas l’oreille d’un agent en temps réel.

Deepgram Nova-3 : du streaming multilingue à grande échelle

Nova-3 de Deepgram est une API de streaming bien établie pour les déploiements multilingues : moins de 300 millisecondes de latence selon le fournisseur, alternance de dix langues en temps réel et personnalisation par domaine. L’annonce de Nova-3 fait état d’un WER médian de 6.84% sur l’audio en streaming. C’est un chiffre du fournisseur ; les indices indépendants le situent plus haut. Il faut donc lire ces chiffres comme du marketing tant qu’on ne les a pas reproduits. Deepgram propose aussi Flux, qui ajoute la détection de fin de tour pour les agents vocaux et reconnaît que le STT classique ne résout pas seul l’alternance des tours.

Choisissez Nova-3 si vous avez besoin de nombreuses langues en production aujourd’hui et acceptez une couche de détection des tours séparée ou Flux en complément.

AssemblyAI Universal : streaming et analyse de la parole réunis

La gamme Universal d’AssemblyAI associe transcription en streaming, résumés, détection d’entités, analyse de sentiment et masquage des données personnelles dans une API. Ses modèles temps réel participent directement aux évaluations d’agents vocaux. Les publications de l’entreprise annoncent un WER de 5.19% pour Universal-3.6 Pro Realtime sur son test d’agents vocaux en anglais, devant Scribe v2 et Nova-3 sur ce même test. Il s’agit d’une évaluation du fournisseur, mais son offre est claire : un fournisseur pour la transcription et l’analyse audio. C’est un bon choix quand la transcription alimente à la fois des analyses et un agent.

Google Chirp 3 : pour les équipes déjà sur Google Cloud

Chirp 3 de Google complète les offres gérées avec une large couverture linguistique et la simplicité opérationnelle de rester chez un fournisseur cloud déjà utilisé par beaucoup d’équipes. Il arrive rarement en tête des classements indépendants de précision en anglais en streaming, mais les contraintes d’achat, les contrats existants, les exigences de conformité et la facture unique le maintiennent dans les déploiements réels.

Ink face à Whisper : quand la référence open source perd

La comparaison la plus fréquente oppose Cartesia Ink à OpenAI Whisper ; elle mérite sa propre réponse. La question semble être de savoir quel modèle est meilleur. La vraie question est de savoir quelle tâche vous devez accomplir.

Whisper gagne pour des fichiers, de nombreuses langues et vos propres GPU : transcriptions par lots d’appels enregistrés, de podcasts ou d’archives, à faible coût et à grande échelle, sans facture fournisseur à la minute.

Ink gagne pour une conversation en direct : il transmet le texte pendant que l’utilisateur parle, valide les mots plus vite, prédit la fin du tour sans modèle séparé et reste précis sur les nombres, identifiants et accents. Ce sont ces erreurs qui entraînent de mauvaises réservations. Avec une couche de streaming autour de Whisper, vous gérez le découpage, la fin de parole et les hallucinations pendant les silences, avec un coût en latence aller-retour.

Un critère pour départager : si votre pipeline comprend déjà Silero, Krisp et une machine à états de délais de silence maintenue par des tentatives répétées, cet ensemble compense l’emploi d’un modèle par lots pour une tâche de streaming. Un modèle conçu pour le streaming le remplace.

Quel modèle de transcription choisir ?

Choisissez selon la tâche :

Votre tâchePoint de départ
Agent vocal en anglais en directInk 2
Transcription multilingue en directDeepgram Nova-3, AssemblyAI Universal realtime
Fichiers par lots, hébergement autonomeWhisper large-v3
Transcription et analyses dans une APIAssemblyAI Universal
Conserver un contrat cloud existantGoogle Chirp 3

Testez ensuite sur votre propre audio avant de vous engager. Tous les chiffres de cette page viennent d’enregistrements d’autres personnes ; le classement qui compte est celui de votre trafic. Faites passer certains de vos appels les plus difficiles, avec des accents, des voix superposées ou un appelant qui épelle un code de confirmation, dans les deux ou trois modèles finalistes. Comparez les résultats, notamment les erreurs que votre produit ne peut pas se permettre.

Si votre tâche concerne les agents vocaux en anglais, essayez Ink 2 dans le Playground sans configuration, ou lisez comment créer un agent vocal pour situer la transcription dans l’ensemble du pipeline.

Documentation associée

FAQ

Quel est le meilleur modèle de transcription vocale ?

Cela dépend de la tâche. Pour l’anglais en streaming dans un agent vocal, Ink 2 était en tête du classement streaming d’Artificial Analysis pour le taux d’erreur de mots en juin 2026 et intègre la détection des tours de parole. Pour le streaming multilingue, Deepgram Nova-3 et les modèles Universal d’AssemblyAI couvrent actuellement davantage de langues. Pour transcrire par lots sur votre propre matériel, Whisper large-v3 est la référence open source. Consultez les classements actuels plutôt que de vous fier à une seule page, y compris celle-ci.

Whisper peut-il transcrire en temps réel ?

Pas nativement. Whisper est un modèle par lots : il attend un segment audio complet avant de renvoyer du texte. Des équipes lui ajoutent une couche de streaming en découpant l’audio et en gérant elles-mêmes la détection de fin de parole, ce qui ajoute de la latence et des risques de panne. Pour la transcription en direct, un modèle conçu pour le streaming, comme Cartesia Ink, Deepgram Nova-3 ou les modèles temps réel d’AssemblyAI, est la voie la plus simple.

Qu’est-ce que le taux d’erreur de mots ? Un WER plus faible est-il toujours préférable ?

Le taux d’erreur de mots (WER) mesure la proportion de mots mal transcrits par rapport à une transcription de référence. C’est un diagnostic utile, pas un verdict complet : il pénalise les choix de mise en forme, dépend du modèle ASR qui a évalué la référence, et deux déploiements au même WER peuvent se comporter très différemment si l’un omet des nombres et des identifiants. Évaluez sur votre propre audio et pondérez les erreurs que votre application ne peut pas tolérer.

Quel modèle transcrit le mieux les nombres et les identifiants ?

Cherchez une évaluation par entité, pas seulement un WER moyen. Numéros de téléphone, adresses e-mail, chaînes alphanumériques et dates échouent autrement que les mots ordinaires. Certains modèles traitent mieux les entités au milieu d’une séquence. Ink 2, par exemple, attend la séquence complète avant de la valider. Quel que soit votre choix, testez les chaînes que votre produit entend réellement : identifiants de commande, codes de confirmation et adresses postales.

Combien coûte Ink 2 ?

Ink 2 est facturé à la minute d’audio, avec des remises sur volume et une tarification personnalisée pour les contrats d’entreprise. Les tarifs actuels figurent sur la page des prix de Cartesia et vous pouvez tester gratuitement le modèle dans le Playground de Cartesia.