Presentiamo Ink-2, un modello di trascrizione vocale costruito per agenti vocali in tempo reale.
A giugno 2026 è primo nella classifica streaming di Artificial Analysis per il tasso di errore sulle parole più basso. Ha il rilevamento dei turni integrato più accurato tra i fornitori, così il modello sa quando ascoltare e quando rispondere.
Tasso di errore sulle parole: trascrizione finale per dataset
Percentuale di parole trascritte in modo errato nella trascrizione finale, dopo il rilevamento della fine del parlato. Valori più bassi sono migliori.
Per gli agenti vocali, la trascrizione deve riuscire in tre aspetti: accuratezza, rilevamento dei turni e latenza. Se uno non funziona, l’esperienza si rompe. L’agente può fraintendere l’utente, interrompere al momento sbagliato, rispondere troppo lentamente o rendere la conversazione innaturale. Ink-2 è stato costruito per eccellere in tutti e tre.
Accuratezza: capire ogni parola
Abbiamo lavorato molto sul riconoscimento di entità strutturate come numeri di telefono, indirizzi email, sequenze alfanumeriche e date. Ink-2 capisce quando un’entità è ancora incompleta e aspetta l’intera sequenza prima di confermarla, senza prompting speciale.
Abbiamo costruito Ink-2 per gestire diversi accenti, come quelli delle chiamate reali con agenti vocali. Su AppTek, un benchmark con 14 accenti inglesi in dialoghi reali di call center, Ink-2 è il migliore fornitore STT in streaming con WER dell’8%, contro il 10% di Deepgram Flux e il 12% di ElevenLabs Scribe v2.
Tasso di errore sulle parole (WER): AppTek
Benchmark su 14 accenti inglesi in dialoghi reali di call center. Valori più bassi sono migliori.
L’accuratezza si mantiene anche in produzione, non solo su audio di riferimento pulito. Il nostro benchmark interno usa audio preso direttamente da chiamate reali con agenti vocali, con parlanti non madrelingua inglesi, rumore di fondo e audio degradato da condizioni di rete scarse. Ink-2 raggiunge una WER del 6.5%, contro il 9.2% di ElevenLabs Scribe v2 e il 9.4% di Deepgram Flux.
Tasso di errore sulle parole (WER): agenti in produzione
Benchmark interno di 36 chiamate reali con i nostri agenti vocali, registrate in condizioni di produzione. Valori più bassi sono migliori.
Entità strutturate e audio reale di produzione mettono davvero alla prova l’accuratezza di un agente vocale dal vivo, oltre ai benchmark puliti. Le dimostrazioni mantengono registrazioni e trascrizioni nella lingua originale.
ink-2
Numero completo e formattato
Trascrive tutte e dieci le cifre e le formatta come numero di telefono.
flux-general-en
Omette l'ultima cifra
Scrive il numero in lettere e perde l'ultima cifra.
Rilevamento dei turni: sapere quando ascoltare e rispondere
L’accuratezza emerge chiaramente nei benchmark, ma è nel rilevamento dei turni che la maggior parte degli agenti vocali fallisce in produzione.
La maggior parte decide che un turno è finito in base al silenzio. Se la pausa è abbastanza lunga, il turno si chiude bruscamente. Funziona nei test, ma in una chiamata reale può interrompere il cliente a metà indirizzo o intervenire subito dopo “e la mia email è…”.
Abbiamo creato Ink-2 con rilevamento semantico del fine turno integrato. Il modello interpreta il significato, non il silenzio, per decidere quando il turno termina. Sa quando un indirizzo è ancora incompleto o un pensiero in sospeso non è un punto di arresto. Il turno rimane aperto finché il modello è sicuro che il parlante abbia finito.
Ink-2 emette nativamente tre eventi, senza bisogno di VAD esterna:
turn.start: l’utente ha iniziato a parlare.turn.eager_end: il modello prevede che il turno stia finendo; l’LLM può iniziare a generare in anticipo.turn.end: il turno è confermato come concluso.
ink-2
Turni: 1
Ha mantenuto l'intero segmento come un unico turno
flux-general-en
Turni: 2
Ha diviso un segmento in turni separati
scribe_v2_realtime
Turni: 3
Ha diviso un segmento in turni separati
Misuriamo il rilevamento dei turni rispetto a un riferimento annotato da persone. La precisione indica quanto spesso il modello ha ragione quando dichiara finito un turno; una bassa precisione significa interrompere le persone. Il richiamo indica quanto spesso riconosce ogni vera fine turno; un basso richiamo crea silenzi imbarazzanti mentre il modello continua ad ascoltare. F1 bilancia le due metriche in un solo punteggio.
Ink-2 mantiene alte sia precisione sia richiamo, mentre le alternative sacrificano l’una per l’altro.
Rilevamento del fine turno: agenti in produzione
Benchmark interno di chiamate reali con agenti vocali in produzione. Valori più alti sono migliori.
In micro1 usiamo Ink-2 per Zara, il nostro agente IA di selezione del personale che conduce colloqui vocali con candidati su larga scala. La latenza è quasi istantanea e la gestione dei turni segue molto bene i modelli delle conversazioni reali.
Latenza: mantenere il flusso della conversazione
Come la latenza TTS, quella di trascrizione influisce direttamente sulla naturalezza della conversazione. La metrica che ci interessa è il tempo fino alla trascrizione finale, TTFT: quanto serve per ottenere il testo finale dal momento in cui l’utente finisce di parlare. Determina se l’agente sembra attento o in attesa di caricamento.
Ink-2 è molto veloce, con un TTFT di 0.1s. E poiché turn.eager_end permette all’LLM di iniziare prima della conferma completa del turno, l’agente risponde abbastanza rapidamente da sembrare davvero presente nella conversazione.
ink-2
Il tuo agente può rispondere prima ancora che il concorrente inizi
flux-general-en
Solo ora l'agente sa che l'interlocutore ha finito e parte da zero
Unisciti ai team che usano Ink-2
Ink-2 è disponibile su play.cartesia.ai, direttamente tramite API e sulle piattaforme usate dai team vocali, tra cui LiveKit, Vapi e Pipecat.
Continueremo a costruire insieme ai team che fanno progredire l’IA vocale e usano Ink-2 in produzione. Abbiamo già pubblicato un modello inglese di alto livello e il supporto multilingue è in arrivo, perché Ink-2 si adatti al modo in cui parlano i tuoi utenti, ovunque siano.
Prova Ink-2
Questa demo di Ink 2 supporta inglese, spagnolo, francese, hindi e giapponese. Per questa demo, parla in inglese.