Oggi presentiamo Ink, una nuova famiglia di modelli di trascrizione vocale in streaming, STT, per gli sviluppatori di applicazioni vocali in tempo reale. Il primo modello è Ink-Whisper, una variante di Whisper di OpenAI ottimizzata per la trascrizione a bassa latenza in contesti conversazionali. Disponibile da oggi, Ink-Whisper è il modello STT più veloce e conveniente, progettato per agenti vocali aziendali.
Da Sonic a Ink: dalla voce in uscita alla voce in ingresso
Con Sonic siamo diventati il fornitore di sintesi vocale preferito da chi dà priorità a velocità, qualità e affidabilità. Il motivo è la leadership di Sonic nella latenza molto bassa, che permette ai clienti di creare esperienze vocali interattive realistiche. Ora ci concentriamo sull’altro lato della conversazione, la trascrizione, con Ink.
Ripensare Whisper per il tempo reale
Per il nostro lancio STT abbiamo guardato a ciò che gli sviluppatori usano già e ai problemi che incontrano. Questo ci ha portato a whisper-large-v3-turbo di OpenAI. È diffuso per buoni motivi: nella trascrizione conversazionale offre un’accuratezza comparabile ai fornitori proprietari, è open source e si può eseguire in modo efficiente.
Gran parte dell’innovazione su Whisper si è concentrata sul throughput, cioè sulla velocità con cui si trascrivono enormi dataset, misurata con il real-time factor, RTF. È utile per la post-elaborazione di file audio lunghi, ma Whisper standard non offre velocità e accuratezza sufficienti per agenti vocali in tempo reale, dove la trascrizione deve essere buona in ogni chiamata, non solo in media. Inoltre, non è stato progettato per condizioni reali difficili.
Whisper è nato per l’elaborazione in massa, non per il dialogo dal vivo. Per questo lo abbiamo riprogettato in Ink-Whisper, specificamente per l’IA vocale in tempo reale, mettendo al centro velocità e contesto reale.
Ink-Whisper è costruito per conversazioni reali
Nelle applicazioni aziendali, gli agenti vocali devono trascrivere il parlato mentre avviene e farlo in modo affidabile in ambienti molto variabili. Abbiamo costruito Ink-Whisper pensando a queste difficoltà e concentrandoci sulle condizioni che mettono in crisi i sistemi STT standard:
- Artefatti della telefonia: l’audio compresso a banda ridotta introduce distorsioni.
- Nomi propri e termini di settore: nomi di prodotti, farmaci o strumenti finanziari richiedono chiarezza.
- Rumore di fondo: traffico, chiacchiere al ristorante, bambini che piangono e disturbi rendono difficile una trascrizione pulita.
- Disfluenze e silenzi: intercalari come “um” e pause confondono le implementazioni standard di Whisper.
- Accenti e variazioni: le voci sono diverse e i modelli STT devono adattarsi.
Uno dei principali miglioramenti rispetto a Whisper standard è la suddivisione dinamica in blocchi. Whisper funziona meglio su blocchi completi di 30 secondi, ma l’IA conversazionale usa segmenti audio molto più piccoli e frammentati. Lo abbiamo modificato per gestire blocchi di lunghezza variabile che terminano in punti semanticamente significativi. Questo significa meno errori e allucinazioni, soprattutto durante silenzi o interruzioni dell’audio.
Per verificare che Ink-Whisper funzioni meglio nelle condizioni reali, abbiamo creato dataset di valutazione che riflettono queste difficoltà comuni:
- Dataset di rumore di fondo: conversazioni registrate nel traffico, in bar o uffici rumorosi.
- Dataset di nomi propri: 100 campioni di SPGISpeech densi di termini finanziari e nomi di marchi.
- Dataset di accenti: trascrizioni con diversi accenti inglesi per verificare la stabilità tra gruppi demografici.
Su questi dataset, Ink-Whisper supera whisper-large-v3-turbo di base in accuratezza misurata con il tasso di errore sulle parole, WER. La sua WER è competitiva anche rispetto ad altri modelli STT in streaming e il modello è ottimizzato per prestazioni in tempo reale adatte alla produzione:
| Tasso di errore sulle parole nei dataset rilevanti | Dettagli del dataset | Cartesia Streaming whisper-natural | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | Assembly Streaming |
|---|---|---|---|---|---|
| Chiamate telefoniche | Conversazioni naturali al telefono | 0.19 | 0.18 | 0.28 | 0.23 |
| Nomi propri | Parlato ricco di gergo | 0.065 | 0.045 | 0.071 | 0.044 |
| Rumori di fondo | Rumore di fondo | 0.033 | 0.038 | 0.099 | 0.027 |
| Disfluenze | Intercalari e rumore | 0.064 | 0.055 | 0.156 | 0.137 |
| Sottoinsieme Speech Accent Archive | Accenti diversi | 0.015 | 0.024 | 0.014 | 0.016 |
Ink-Whisper è il modello in streaming più veloce
Oltre all’accuratezza, la trascrizione in streaming deve essere molto veloce per ottenere conversazioni realistiche. Con Ink-Whisper poniamo l’accento su una nuova metrica: il tempo fino alla trascrizione completa, TTCT. Misura quanto rapidamente l’intera trascrizione è pronta dopo che l’utente smette di parlare. Determina quanto velocemente l’intero sistema possa rispondere, come un ascoltatore attento dal vivo.
Il ritardo nella risposta rivela subito un bot poco naturale. Questi ritardi spezzano il ritmo della conversazione e portano a chiamate interrotte, utenti frustrati e ricavi persi. Ridurre al minimo il TTCT significa velocità, ma soprattutto rendere l’interazione umana.
Ink-Whisper supera whisper-large-v3-turbo di base sul TTCT. Offre infatti il TTCT più basso tra tutti i modelli di trascrizione vocale in streaming che abbiamo testato:
| Tempo per completare la trascrizione dopo l’ultimo audio inviato | Cartesia Streaming Ink-Whisper | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | AssemblyAI Universal Streaming |
|---|---|---|---|---|
| Mediana (ms) | 66 | 74 | 70 | 737 |
| P90 (ms) | 98 | 109 | 189 | 829 |
Whisper standard resta uno dei modelli STT aperti più versatili, ma non è nato per il tempo reale. Ink-Whisper cambia questo limite con ottimizzazioni per accuratezza conversazionale e latenza molto bassa. Offre il TTCT più veloce che abbiamo osservato, con buoni risultati su parlato rumoroso, con accenti diversi e dinamico. Lo abbiamo valutato nelle condizioni reali degli agenti vocali, non in un laboratorio o studio controllato.
Ink-Whisper è il modello in streaming più conveniente
Crediamo nel futuro della voce e rendiamo Ink-Whisper accessibile a chi costruisce soluzioni vocali. È il modello STT in streaming più veloce e conveniente disponibile. A solo 1 credito al secondo, o $0.13 all’ora nel piano Scale, offre trascrizione in tempo reale di alto livello al prezzo più basso.
Iniziare con Ink-Whisper è semplice:
- Si integra con Vapi, Pipecat e LiveKit, così puoi avviare interazioni vocali in streaming in pochi minuti.
- Con disponibilità del 99.9% e conformità per le imprese a SOC 2 Type II, HIPAA e PCI, puoi distribuirlo su larga scala.
Inizia qui oppure consulta la documentazione.
Il futuro dell’IA vocale con Cartesia
La domanda di agenti vocali cresce rapidamente. Quelli più efficaci usano IA audio avanzata come il nostro modello di sintesi vocale Sonic. Con Ink-Whisper rispondiamo ora a quella domanda anche sull’altro lato, per conversazioni veloci e naturali. Il lancio di oggi è un primo esempio di come stiamo ripensando lo stack vocale in tempo reale. Seguiranno altri aggiornamenti.
