Blog / Novità

Presentiamo Ink-2:Il modello STT numero 1 per agenti vocali

Eli Pugh 

Presentiamo Ink-2, un modello di trascrizione vocale costruito per agenti vocali in tempo reale.

A giugno 2026 è primo nella classifica streaming di Artificial Analysis per il tasso di errore sulle parole più basso. Ha il rilevamento dei turni integrato più accurato tra i fornitori, così il modello sa quando ascoltare e quando rispondere.

Tasso di errore sulle parole: trascrizione finale per dataset

Percentuale di parole trascritte in modo errato nella trascrizione finale, dopo il rilevamento della fine del parlato. Valori più bassi sono migliori.

Artificial AnalysisGiugno 2026
AA-AgentTalkVoxPopuliEarnings22
3.4%
2.4%
5.3%
Ink-2 (fine turno semantico)
Cartesia
2.8%
2.3%
6.4%
Scribe v2 Realtime
ElevenLabs
3.6%
2.1%
7.2%
U3.5 Pro Realtime
AssemblyAI
6.7%
4.9%
11.4%
Flux
Deepgram
Ink-2 (fine turno semantico)
Cartesia
3.4%
2.4%
5.3%
Scribe v2 Realtime
ElevenLabs
2.8%
2.3%
6.4%
U3.5 Pro Realtime
AssemblyAI
3.6%
2.1%
7.2%
Flux
Deepgram
6.7%
4.9%
11.4%

Per gli agenti vocali, la trascrizione deve riuscire in tre aspetti: accuratezza, rilevamento dei turni e latenza. Se uno non funziona, l’esperienza si rompe. L’agente può fraintendere l’utente, interrompere al momento sbagliato, rispondere troppo lentamente o rendere la conversazione innaturale. Ink-2 è stato costruito per eccellere in tutti e tre.

Accuratezza: capire ogni parola

Abbiamo lavorato molto sul riconoscimento di entità strutturate come numeri di telefono, indirizzi email, sequenze alfanumeriche e date. Ink-2 capisce quando un’entità è ancora incompleta e aspetta l’intera sequenza prima di confermarla, senza prompting speciale.

Abbiamo costruito Ink-2 per gestire diversi accenti, come quelli delle chiamate reali con agenti vocali. Su AppTek, un benchmark con 14 accenti inglesi in dialoghi reali di call center, Ink-2 è il migliore fornitore STT in streaming con WER dell’8%, contro il 10% di Deepgram Flux e il 12% di ElevenLabs Scribe v2.

Tasso di errore sulle parole (WER): AppTek

Benchmark su 14 accenti inglesi in dialoghi reali di call center. Valori più bassi sono migliori.

8%
Ink-2
Cartesia
10%
Flux
Deepgram
12%
Scribe v2 Realtime
ElevenLabs
13%
U3.5 Pro Realtime
AssemblyAI

L’accuratezza si mantiene anche in produzione, non solo su audio di riferimento pulito. Il nostro benchmark interno usa audio preso direttamente da chiamate reali con agenti vocali, con parlanti non madrelingua inglesi, rumore di fondo e audio degradato da condizioni di rete scarse. Ink-2 raggiunge una WER del 6.5%, contro il 9.2% di ElevenLabs Scribe v2 e il 9.4% di Deepgram Flux.

Tasso di errore sulle parole (WER): agenti in produzione

Benchmark interno di 36 chiamate reali con i nostri agenti vocali, registrate in condizioni di produzione. Valori più bassi sono migliori.

Valutazione CartesiaLuglio 2026
6.5%
Ink-2
Cartesia
9.2%
Scribe v2 Realtime
ElevenLabs
9.4%
Flux
Deepgram
10.7%
U3.5 Pro Realtime
AssemblyAI

Entità strutturate e audio reale di produzione mettono davvero alla prova l’accuratezza di un agente vocale dal vivo, oltre ai benchmark puliti. Le dimostrazioni mantengono registrazioni e trascrizioni nella lingua originale.

ink-2

Numero completo e formattato

Trascrive tutte e dieci le cifre e le formatta come numero di telefono.

flux-general-en

Omette l'ultima cifra

Scrive il numero in lettere e perde l'ultima cifra.

Rilevamento dei turni: sapere quando ascoltare e rispondere

L’accuratezza emerge chiaramente nei benchmark, ma è nel rilevamento dei turni che la maggior parte degli agenti vocali fallisce in produzione.

La maggior parte decide che un turno è finito in base al silenzio. Se la pausa è abbastanza lunga, il turno si chiude bruscamente. Funziona nei test, ma in una chiamata reale può interrompere il cliente a metà indirizzo o intervenire subito dopo “e la mia email è…”.

Abbiamo creato Ink-2 con rilevamento semantico del fine turno integrato. Il modello interpreta il significato, non il silenzio, per decidere quando il turno termina. Sa quando un indirizzo è ancora incompleto o un pensiero in sospeso non è un punto di arresto. Il turno rimane aperto finché il modello è sicuro che il parlante abbia finito.

Ink-2 emette nativamente tre eventi, senza bisogno di VAD esterna:

  • turn.start: l’utente ha iniziato a parlare.
  • turn.eager_end: il modello prevede che il turno stia finendo; l’LLM può iniziare a generare in anticipo.
  • turn.end: il turno è confermato come concluso.

ink-2

Turni: 1

Ha mantenuto l'intero segmento come un unico turno

flux-general-en

Turni: 2

Ha diviso un segmento in turni separati

scribe_v2_realtime

Turni: 3

Ha diviso un segmento in turni separati

Misuriamo il rilevamento dei turni rispetto a un riferimento annotato da persone. La precisione indica quanto spesso il modello ha ragione quando dichiara finito un turno; una bassa precisione significa interrompere le persone. Il richiamo indica quanto spesso riconosce ogni vera fine turno; un basso richiamo crea silenzi imbarazzanti mentre il modello continua ad ascoltare. F1 bilancia le due metriche in un solo punteggio.

Ink-2 mantiene alte sia precisione sia richiamo, mentre le alternative sacrificano l’una per l’altro.

Rilevamento del fine turno: agenti in produzione

Benchmark interno di chiamate reali con agenti vocali in produzione. Valori più alti sono migliori.

Valutazione CartesiaLuglio 2026
PrecisioneRichiamoF1
89%
97%
93%
Ink-2
Cartesia
80%
97%
88%
Flux
Deepgram
74%
97%
84%
U3.5 Pro Realtime
AssemblyAI
89%
87%
88%
Scribe v2 Realtime
ElevenLabs
Ink-2
Cartesia
89%
97%
93%
Flux
Deepgram
80%
97%
88%
U3.5 Pro Realtime
AssemblyAI
74%
97%
84%
Scribe v2 Realtime
ElevenLabs
89%
87%
88%

In micro1 usiamo Ink-2 per Zara, il nostro agente IA di selezione del personale che conduce colloqui vocali con candidati su larga scala. La latenza è quasi istantanea e la gestione dei turni segue molto bene i modelli delle conversazioni reali.

Aruj MahajanIA presso micro1

Latenza: mantenere il flusso della conversazione

Come la latenza TTS, quella di trascrizione influisce direttamente sulla naturalezza della conversazione. La metrica che ci interessa è il tempo fino alla trascrizione finale, TTFT: quanto serve per ottenere il testo finale dal momento in cui l’utente finisce di parlare. Determina se l’agente sembra attento o in attesa di caricamento.

Ink-2 è molto veloce, con un TTFT di 0.1s. E poiché turn.eager_end permette all’LLM di iniziare prima della conferma completa del turno, l’agente risponde abbastanza rapidamente da sembrare davvero presente nella conversazione.

ink-2

10.1 s prima

Il tuo agente può rispondere prima ancora che il concorrente inizi

flux-general-en

15.9s

Solo ora l'agente sa che l'interlocutore ha finito e parte da zero

Unisciti ai team che usano Ink-2

ServiceNow
HeyGen
Micro1
Synthesia

Ink-2 è disponibile su play.cartesia.ai, direttamente tramite API e sulle piattaforme usate dai team vocali, tra cui LiveKit, Vapi e Pipecat.

Continueremo a costruire insieme ai team che fanno progredire l’IA vocale e usano Ink-2 in produzione. Abbiamo già pubblicato un modello inglese di alto livello e il supporto multilingue è in arrivo, perché Ink-2 si adatti al modo in cui parlano i tuoi utenti, ovunque siano.

Prova Ink-2

Questa demo di Ink 2 supporta inglese, spagnolo, francese, hindi e giapponese. Per questa demo, parla in inglese.

Fai clic o premi Space per avviare una trascrizione
Tocca per avviare una trascrizione
Ti serve un argomento?
A quale hobby ti stai appassionando ultimamente?

Prova Ink-2 oggi

Prova Cartesia (Inglese)