Trascrizione vocale in diretta nel browser

Fai clic sul microfono, inizia a parlare e guarda apparire la trascrizione. Usa Ink-2, al primo posto per accuratezza nella trascrizione vocale in streaming.

Questa demo di Ink 2 supporta inglese, spagnolo, francese, hindi e giapponese. Per questa demo, parla in inglese.

Fai clic o premi Space per avviare una trascrizione
Tocca per avviare una trascrizione
Ti serve un argomento?
Quale piccola cosa ti ha fatto sorridere di recente?

Basato su Ink-2, n. 1 per accuratezza nello streaming

La demo qui sopra usa Ink-2, il nostro modello di trascrizione vocale in streaming. È al primo posto nella classifica VoiceArena per l'inglese statunitense e nel benchmark di streaming di Artificial Analysis, e trascrive correttamente fin dal primo tentativo dati strutturati come numeri di telefono, email e UUID. Il rilevamento dei turni è integrato, quindi la trascrizione si suddivide autonomamente in turni e rimane accurata in presenza di rumore di fondo, senza un filtro di pulizia separato.

Ideale per

  • Agenti vocali
  • Sottotitoli in diretta
  • Dettatura
  • Appunti delle riunioni
  • Analisi delle chiamate

Come funziona

01

Fai clic sul microfono e parla. Le parole compaiono mentre parli, senza registrazione.

02

Fai una pausa o cambia argomento durante lo streaming. Ink-2 indica dove iniziano e finiscono i turni, così la trascrizione si legge come una conversazione.

03

Copia la trascrizione o usa lo stesso modello in streaming dalla tua app tramite l'API.

Portalo in produzione

Il modello alla base di questa pagina è lo stesso Ink-2 disponibile tramite le nostre API e SDK. Trasmetti audio in diretta tramite WebSocket per l'uso in tempo reale oppure invia file completi all'endpoint batch. Il prompting con termini chiave orienta il riconoscimento verso i nomi e il gergo che il tuo prodotto incontra più spesso. I piani enterprise aggiungono distribuzioni on-premise, VPC e OEM senza conservazione dei dati.

Domande frequenti

Che cos'è la trascrizione vocale?

La trascrizione vocale, chiamata anche STT, ASR o speech to text, trasforma l'audio parlato in parole scritte. La versione di Cartesia usa Ink-2, un modello in streaming, quindi la trascrizione appare mentre stai ancora parlando, anziché quando hai finito.

Questo strumento di trascrizione vocale è gratuito?

Sì. La demo in questa pagina trascrive l'audio del microfono senza bisogno di un account. Un account Cartesia gratuito aumenta i limiti e i piani a pagamento offrono volumi API per la produzione.

Quali lingue supporta?

Ink-2 trascrive inglese, francese, hindi, giapponese e spagnolo e rileva automaticamente la lingua. È pensato per l'uso in tempo reale; per i file preregistrati, l'API STT batch usa ink-whisper.

Che cos'è il rilevamento dei turni?

Il rilevamento dei turni determina quando un parlante ha finito, evitando che un agente vocale interrompa o lasci silenzi. La maggior parte degli stack aggiunge un modello separato di rilevamento dell'attività vocale. Ink-2 emette direttamente eventi di turno come turn.eager_end e turn.end, riducendo di uno i modelli nello stack e rendendo più rapide le risposte.

Posso trascrivere file audio invece di usare il microfono?

La demo in questa pagina funziona in diretta tramite il microfono. Per le registrazioni, usa l'API STT batch, che accetta un file completo e restituisce una trascrizione.

Posso eseguirlo sulla mia infrastruttura?

Sì. Ink-2 può essere distribuito on-premise, anche in ambienti isolati dalla rete, nel tuo VPC su AWS, GCP o Azure, oppure integrato nel tuo prodotto con una licenza OEM. Queste modalità di distribuzione sono disponibili con contratti enterprise.

Inizia oggi

Parla con un esperto.

Contatta un membro del nostro team e scopri come Cartesia può aiutarti a creare esperienze vocali di altissimo livello.

Contatta il team commerciale

Inizia a sviluppare.

Accedi ai nostri modelli tramite API e porta un agente vocale in produzione in pochi minuti.

Prova Cartesia