Impara

I migliori modelli da voce a testo a confronto (2026)

Rene 
I migliori modelli da voce a testo a confronto (2026)

Stai confrontando modelli da voce a testo perché qualcosa a valle non ha funzionato: un agente ha prenotato il giorno sbagliato, una trascrizione ha alterato un numero di telefono o un processo batch è costato più del prodotto che alimenta. Questa pagina organizza i modelli rilevanti nel 2026 in base al lavoro che devono svolgere e indica i limiti di ciascuno.

Per trascrivere audio inglese dal vivo per un agente vocale, Ink 2 è il punto di partenza più forte. A giugno 2026 era primo nella classifica di trascrizione streaming di Artificial Analysis per tasso di errore delle parole e gestisce il rilevamento dei turni senza un modello separato. Per lo streaming multilingue, Deepgram Nova-3 e i modelli Universal di AssemblyAI coprono oggi più lingue. Per trascrivere file registrati su hardware sotto il tuo controllo, Whisper large-v3 di OpenAI è la scelta open source di riferimento. Le classifiche cambiano; consulta quelle attuali invece di fidarti di una sola pagina, compresa questa.

Streaming e batch sono lavori diversi

La prima distinzione non è fra fornitori, ma fra due tipi di lavoro:

  • La trascrizione in streaming, in tempo reale, restituisce testo mentre la persona sta ancora parlando. Serve ad agenti vocali, sottotitoli dal vivo e instradamento delle chiamate. Il modello conferma parole che ha ascoltato solo in parte, quindi va giudicato per accuratezza, latenza e capacità di capire quando chi parla ha concluso un pensiero.
  • La trascrizione batch riceve una registrazione completa e restituisce una trascrizione. Rientrano qui la postproduzione di podcast, gli appunti delle riunioni e le verifiche di conformità. La latenza conta molto meno; accuratezza e costo orario contano di più.

Un modello costruito per un lavoro raramente eccelle nell’altro. Whisper è il caso più chiaro: ottima accuratezza batch per un modello aperto, nessuno streaming nativo. Scegliere in base a una sola classifica aggregata nasconde questa differenza. Per questo i confronti seguenti sono raggruppati per lavoro.

Come valutare un modello da voce a testo

Tre criteri decidono la maggior parte delle implementazioni in tempo reale:

  1. Accuratezza, soprattutto sulle stringhe importanti per il tuo prodotto. La WER media nasconde gli errori dannosi. Un modello può avere una WER complessiva rispettabile e comunque alterare codici di conferma e indirizzi e-mail o omettere senza avviso un numero pronunciato. Sono proprio gli errori che interrompono il flusso di prenotazione di un agente. Abbiamo approfondito il problema nella guida al tasso di errore delle parole. La WER è un indicatore diagnostico, non un verdetto, perché dipende dalla trascrizione di riferimento e non dice quali errori un ascoltatore può accettare.
  2. Rilevamento dei turni. In una conversazione, qualcuno deve decidere quando l’utente ha smesso di parlare. Molti sistemi aggiungono un rilevatore di attività vocale e un timeout di silenzio; questa combinazione sbaglia sulle pause, e ogni modello aggiuntivo nel pipeline aumenta la latenza. I modelli con previsione della fine del turno integrata eliminano del tutto quel componente.
  3. Latenza in condizioni reali. Le pagine dei fornitori citano tempi mediani su audio pulito. Il tuo audio contiene accenti, voci sovrapposte e rumore di fondo, e il p95 è ciò che sperimenta chi chiama. Misura il tempo necessario a ottenere la trascrizione finale su registrazioni simili al tuo traffico.

Il prezzo è il quarto criterio, e qui la risposta onesta è poco interessante: le tariffe al minuto differiscono di pochi decimi di centesimo, cambiano spesso e contano meno della scelta di un modello che non fraintenda i clienti. Consulta le pagine prezzi aggiornate al momento della lettura.

I modelli da confrontare

Questi sono i modelli che incontra chi seleziona soluzioni da voce a testo nel 2026. Le affermazioni provengono dai materiali dei singoli fornitori o da classifiche indipendenti, distinguendo le due fonti.

Cartesia Ink 2 per l’inglese in streaming negli agenti vocali

Ink 2 è un modello streaming costruito per agenti in tempo reale, ed è il modello che sviluppiamo noi. Ecco i suoi punti di forza secondo il post di lancio e la classifica streaming di Artificial Analysis, dove a giugno 2026 era primo per tasso di errore delle parole:

  • Accuratezza sull’audio di produzione, comprese registrazioni telefoniche, parlato con accenti, ambienti rumorosi e presentazioni dei risultati finanziari. In quei test ha superato Deepgram Flux, Soniox RT-V4, i modelli realtime di AssemblyAI ed ElevenLabs Scribe-2-realtime. Gestisce entità strutturate come numeri di telefono, e-mail, UUID e date aspettando la sequenza completa prima di confermarla.
  • Rilevamento dei turni integrato. La previsione della fine del turno fa parte del modello, quindi non serve eseguire Silero o un servizio separato per l’alternanza dei turni. In un pipeline Pipecat, le previsioni anticipate di fine turno di Ink hanno ridotto di circa mezzo secondo il tempo di risposta, consentendo all’agente di iniziare a rispondere prima della conclusione formale del turno dell’utente.
  • Resistenza al rumore senza filtro di pre-elaborazione, eliminando dal sistema una fase come Krisp e il relativo costo e latenza.

I limiti sono chiari: oggi Ink 2 trascrive solo l’inglese, con un modello multilingue in anteprima. Se i tuoi agenti ricevono oggi chiamate in spagnolo o hindi, scegli tra le opzioni multilingue qui sotto e rivaluta in seguito. Cartesia offre distribuzione cloud, on-premise e in ambienti isolati dalla rete, e puoi provare Ink gratuitamente nel playground.

OpenAI Whisper large-v3 come riferimento open source per il batch

Whisper è il modello da battere per la trascrizione batch sulle proprie GPU: pesi aperti, circa 99 lingue, buona accuratezza su audio pulito e nessun vincolo verso un fornitore. I team lo ospitano autonomamente per carichi sensibili alla privacy o ai costi.

Il suo limite emerge proprio nel lavoro indicato dal titolo di questa pagina. Whisper è solo batch: niente streaming nativo, niente rilevamento dei turni e una tendenza nota a inventare frasi durante il silenzio o su audio senza parlato. È il difetto segnalato nell’articolo di AssemblyAI, che ogni livello di streaming costruito intorno a Whisper eredita. Le configurazioni streaming a blocchi aggiungono circa 500 millisecondi di latenza e devono gestire da sole il rilevamento della fine del parlato. Usa Whisper per i file. Non usarlo come orecchio di un agente in tempo reale.

Deepgram Nova-3 per lo streaming multilingue su larga scala

Nova-3 di Deepgram è un’API streaming affermata per implementazioni multilingue: latenza inferiore a 300 millisecondi secondo il fornitore, alternanza in tempo reale fra dieci lingue e personalizzazione per dominio. Il post di lancio di Nova-3 riporta una WER mediana del 6.84% sull’audio streaming. È un dato del fornitore; gli indici indipendenti riportano valori più alti, un promemoria per trattare i numeri dei fornitori come marketing finché non li riproduci. Deepgram offre anche Flux, un modello che aggiunge il rilevamento della fine del turno per gli agenti vocali, riconoscendo che il solo STT classico non risolve l’alternanza dei turni.

Scegli Nova-3 se ti servono molte lingue in produzione oggi e puoi accettare un livello separato di rilevamento dei turni o Flux al suo fianco.

AssemblyAI Universal con streaming e analisi del parlato integrate

La linea Universal di AssemblyAI combina trascrizione streaming con riassunti, rilevamento delle entità, analisi del sentiment e oscuramento dei dati personali in un’unica API. I suoi modelli realtime competono direttamente nei benchmark degli agenti vocali. Gli articoli dell’azienda riportano una WER del 5.19% per Universal-3.6 Pro Realtime nel proprio benchmark inglese per agenti vocali, davanti a Scribe v2 e Nova-3 nello stesso test. Consideralo un benchmark eseguito dal fornitore. Il posizionamento è chiaro: un unico fornitore per trascrizione e analisi audio. È una buona scelta quando la trascrizione alimenta sia l’analisi sia un agente.

Google Chirp 3 per i team già su Google Cloud

Chirp 3 di Google completa le opzioni gestite, con un’ampia copertura linguistica e la semplicità operativa di restare presso un provider cloud che molti team già usano. Raramente guida le classifiche indipendenti di accuratezza per l’inglese in streaming, ma la realtà degli acquisti, fra contratti esistenti, requisiti di conformità e un’unica fattura, lo mantiene nelle implementazioni reali.

Ink contro Whisper, quando il riferimento open source perde

Il confronto più comune che vediamo è fra Cartesia Ink e OpenAI Whisper, quindi merita una risposta a parte. La domanda sembra essere “quale modello è migliore”, ma quella vera è “quale lavoro devi svolgere”.

Whisper vince quando hai file, molte lingue e GPU proprie: trascrizioni batch di chiamate registrate, podcast o archivi, a basso costo su larga scala e senza fatture al minuto da un fornitore.

Ink vince quando hai una conversazione dal vivo: trascrive in streaming mentre l’utente parla, conferma le parole più rapidamente, prevede la fine del turno senza un modello separato e mantiene l’accuratezza su numeri, identificativi e accenti. Sono gli errori che diventano prenotazioni sbagliate. Eseguire Whisper dietro un livello streaming significa gestire suddivisione in blocchi, rilevamento della fine del parlato e allucinazioni durante il silenzio, pagandone il costo in latenza di andata e ritorno.

Un criterio utile per decidere: se il tuo pipeline comprende già Silero, Krisp e una macchina a stati con timeout di silenzio tenuta insieme da nuovi tentativi, quel sistema serve a compensare un modello batch usato per un lavoro streaming. Un modello nativo per lo streaming lo sostituisce.

Quale modello da voce a testo scegliere?

Abbina il modello al lavoro:

Il tuo lavoroDa dove iniziare
Agente vocale inglese dal vivoInk 2
Trascrizione multilingue dal vivoDeepgram Nova-3, AssemblyAI Universal realtime
File batch, con hosting proprioWhisper large-v3
Trascrizione e analisi in un’APIAssemblyAI Universal
Restare in un contratto cloud esistenteGoogle Chirp 3

Poi prova sui tuoi audio prima di decidere. Ogni cifra in questa pagina proviene da registrazioni altrui; la classifica che conta è quella prodotta dal tuo traffico. Fai ascoltare ai due o tre finalisti alcune delle chiamate più difficili, con accenti, voci sovrapposte o una persona che scandisce un codice di conferma. Confronta i risultati, compresi gli errori che il tuo prodotto non può permettersi.

Se il lavoro riguarda agenti vocali inglesi, prova Ink 2 nel playground senza configurazione oppure leggi come costruire un agente vocale per capire dove si inserisce la trascrizione nel pipeline completo.

Documentazione correlata

Domande frequenti

Qual è il miglior modello da voce a testo?

Dipende dal lavoro. Per l'inglese in streaming in un agente vocale, Ink 2 era in testa alla classifica streaming di Artificial Analysis per tasso di errore delle parole a giugno 2026 e integra il rilevamento dei turni. Per lo streaming multilingue, Deepgram Nova-3 e i modelli Universal di AssemblyAI coprono oggi più lingue. Per la trascrizione batch sul proprio hardware, Whisper large-v3 è la scelta open source di riferimento. Consulta le classifiche attuali invece di fidarti di una singola pagina, compresa questa.

Whisper può trascrivere in tempo reale?

Non in modo nativo. Whisper è un modello batch: attende un segmento audio completo prima di restituire il testo. I team costruiscono livelli di streaming suddividendo l'audio in blocchi e gestendo autonomamente il rilevamento della fine del parlato, con più latenza e possibili guasti. Per la trascrizione dal vivo, un modello nativo per lo streaming come Cartesia Ink, Deepgram Nova-3 o i modelli realtime di AssemblyAI è la strada più semplice.

Che cos'è il tasso di errore delle parole? Una WER inferiore è sempre migliore?

Il tasso di errore delle parole (WER) è la quota di parole che un modello trascrive in modo errato rispetto a una trascrizione di riferimento. È un indicatore diagnostico utile, non un verdetto completo: penalizza le scelte di formattazione, dipende dal modello ASR che ha valutato il riferimento e due implementazioni con la stessa WER possono dare risultati molto diversi se una omette numeri e identificativi. Valuta sui tuoi audio e dai più peso agli errori che l'applicazione non tollera.

Quale modello da voce a testo gestisce meglio numeri e identificativi?

Cerca valutazioni a livello di entità, non solo la WER media. Numeri di telefono, indirizzi e-mail, sequenze alfanumeriche e date producono errori diversi dalle parole comuni, e alcuni modelli gestiscono meglio le entità nel mezzo di una sequenza. Ink 2, per esempio, attende la sequenza completa prima di confermarla. Qualunque modello tu scelga, provalo con le stringhe che il tuo prodotto ascolta davvero: numeri d'ordine, codici di conferma e indirizzi.

Quanto costa Ink 2?

Ink 2 ha un prezzo al minuto di audio, con sconti per volume e prezzi personalizzati nei contratti aziendali. Le tariffe attuali sono nella pagina prezzi di Cartesia e puoi provare il modello gratuitamente nel playground di Cartesia.