La transcription, en direct dans votre navigateur

Cliquez sur le micro, parlez et regardez la transcription apparaître. Elle repose sur Ink-2, classé numéro 1 pour la précision de la reconnaissance vocale en streaming.
Cliquez ou appuyez sur Space pour lancer une transcription
Appuyez pour lancer une transcription
Besoin d'un sujet ?
Quel est le dernier très bon repas que vous avez mangé ?

Avec Ink-2, numéro 1 pour la précision en streaming

La démo ci-dessus utilise Ink-2, notre modèle de reconnaissance vocale en streaming. Il occupe la première place du classement VoiceArena en anglais américain et benchmark de streaming d'Artificial Analysis, et transcrit correctement dès la première fois les données structurées comme les numéros de téléphone, les e-mails et les UUID. La détection intégrée des tours de parole structure automatiquement la transcription. Le modèle reste précis malgré le bruit de fond, sans filtre de nettoyage séparé.

Idéal pour

  • Agents vocaux
  • Sous-titres en direct
  • Dictée
  • Notes de réunion
  • Analyse des appels

Comment ça marche

01

Cliquez sur le micro et parlez. Les mots apparaissent pendant que vous parlez, sans inscription.

02

Faites une pause ou changez de sujet en cours de route. Ink-2 marque le début et la fin des tours de parole pour que la transcription ressemble à une conversation.

03

Copiez la transcription ou utilisez le même modèle en streaming depuis votre application via l'API.

Passer en production

Le modèle utilisé sur cette page est le même Ink-2 que celui de nos API et SDK. Diffusez l'audio en direct via WebSocket pour le temps réel, ou envoyez des fichiers complets au point de terminaison par lots. Le guidage par termes clés oriente la reconnaissance vers les noms et le jargon les plus fréquents dans votre produit. Les offres entreprise ajoutent les déploiements sur site, en VPC et sous licence OEM, sans conservation des données.

FAQ

Qu'est-ce que la reconnaissance vocale ?

La reconnaissance vocale, aussi appelée STT, ASR ou transcription, transforme l'audio parlé en texte. La solution de Cartesia repose sur Ink-2, un modèle en streaming : la transcription apparaît pendant que vous parlez, sans attendre la fin.

Cet outil de reconnaissance vocale est-il gratuit ?

Oui. La démo de cette page transcrit votre microphone sans compte. Un compte Cartesia gratuit augmente les limites, et les offres payantes ajoutent du volume API pour la production.

Quelles langues sont prises en charge ?

Ink-2 transcrit l'anglais, le français, l'hindi, le japonais et l'espagnol, avec détection automatique de la langue. Il est conçu pour le temps réel. Pour les fichiers préenregistrés, l'API de transcription par lots utilise ink-whisper.

Qu'est-ce que la détection des tours de parole ?

La détection des tours de parole détermine quand une personne a terminé, pour éviter que l'agent vocal l'interrompe ou laisse un silence. La plupart des systèmes ajoutent un modèle distinct de détection d'activité vocale. Ink-2 émet lui-même des événements comme turn.eager_end et turn.end : un modèle de moins à intégrer et des réponses plus rapides.

Puis-je transcrire des fichiers audio plutôt que mon microphone ?

La démo de cette page fonctionne en direct avec le microphone. Pour les enregistrements, utilisez l'API de transcription par lots, qui accepte un fichier complet et renvoie une transcription.

Puis-je l'exécuter dans ma propre infrastructure ?

Oui. Ink-2 peut être déployé sur site, y compris dans des environnements isolés du réseau, dans votre VPC sur AWS, GCP ou Azure, ou intégré à votre produit sous licence OEM. Ces déploiements sont disponibles dans le cadre de contrats entreprise.

Commencer aujourd'hui

Parlez à un expert.

Échangez avec notre équipe et découvrez comment Cartesia peut vous aider à créer des expériences vocales de premier plan.

Contacter les ventes

Commencez à développer.

Accédez à nos modèles via l'API et mettez un agent vocal en production en quelques minutes.

Essayer Cartesia