Ink: il modello di trascrizione vocale più veloce e accurato
Questa demo di Ink 2 supporta inglese, spagnolo, francese, hindi e giapponese. Per questa demo, parla in inglese.
Unisciti ai team che passano a Cartesia
Un modello di trascrizione per ogni ambiente in cui ti porta la tua attività
I treni passano rombando, gli annunci crepitano dagli altoparlanti. Ink-2 trascrive ogni parola del chiamante.
Città rumorosa
Progettato per gli agenti vocali
Quattro funzionalità che rendono Ink il livello di trascrizione su cui si basano gli agenti in produzione.
Precisione
Capisce bene al primo tentativo.
In pratica
In un agente vocale, la trascrizione è la base su cui si costruisce tutto il resto. Un errore di trascrizione compromette l'input dell'LLM e porta l'interazione nella direzione sbagliata.
È altrettanto vero il contrario: l'accuratezza si amplifica e una trascrizione precisa significa una risposta migliore e una chiamata che si risolve.
L'approccio di Ink-2
Ink ha il Word Error Rate (WER) più basso di qualsiasi modello STT in streaming e gestisce nativamente dati strutturati come numeri di telefono, date, email, valute e UUID. Pensato per contesti audio reali: telefonia, rumore di fondo, accenti diversi e altro ancora.
Date, codici alfanumerici, ID
Fluidità della conversazione
Sa quando inizi e finisci.
In pratica
Una conversazione ha due momenti decisivi: quando un chiamante inizia a parlare e quando finisce. Se perde l'inizio, l'agente perde l'intero turno. Se reagisce troppo presto alla fine, interviene a metà pensiero. Il modello di trascrizione giusto riconosce entrambi senza attesa.
L'approccio di Ink-2
Ink-2 ha il rilevamento nativo dei turni: turn.start e turn.end vengono segnalati direttamente dal modello, senza un VAD esterno da integrare o mantenere. Per una latenza inferiore, turn.eager_end dà all'LLM un vantaggio prima che il turno sia confermato completo.
Il rilevamento semantico della fine del turno si basa sul significato, non sul silenzio, quindi le pause a metà pensiero non attivano l'agente prematuramente.
ink-2
Il tuo agente può rispondere prima ancora che il concorrente inizi
flux-general-en
Solo ora l'agente sa che l'interlocutore ha finito e parte da zero
Velocità
Il chiamante smette di parlare.
L'agente inizia a pensare.
In pratica
Quando la trascrizione è veloce e costante, la risposta dell'agente sembra immediata. Una trascrizione lenta su dieci significa una chiamata su dieci in cui quella prontezza viene meno. Nove ottime chiamate non cancellano quella che non ha funzionato bene.
L'approccio di Ink-2
Ink è il modello ASR in streaming più veloce, basato su un motore di inferenza personalizzato progettato per conversazioni in tempo reale. Il tempo fino alla trascrizione finale è di 0,1 s, con turn.eager_end che riduce l'intervallo tra l'ultima parola e la prima risposta.
Costo
Qualità che non costa di più quando cresci.
In pratica
La voce è l'interfaccia più naturale per comunicare. Il giusto equilibrio tra costo e qualità su larga scala permette di portare la voce ovunque, come interfaccia predefinita di ogni interazione con agenti.
L'approccio di Ink-2
L'architettura State Space Model di Ink offre un throughput 10-100 volte superiore ai transformer, con costi di calcolo inferiori su larga scala e senza compromessi sulla qualità. L'ottimizzazione continua del nostro stack di modelli migliora l'economia unitaria man mano che cresci.
Sicurezza di livello enterprise.Dal cloud al locale.
Conforme a HIPAA

SOC 2 Type 2

GDPR

PCI
Domande frequenti
Perché Ink-2 è il miglior STT per gli agenti vocali?
Ink-2 è il modello di trascrizione vocale in streaming di Cartesia, progettato appositamente per agenti vocali in produzione. Come il nostro TTS, si basa sull'architettura State Space Model (SSM), sviluppata dal nostro team fondatore a Stanford, che permette a Ink-2 di offrire tre cose contemporaneamente:
Il WER più basso tra tutti i modelli STT in streaming. Ink-2 supera Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro, ElevenLabs Scribe-2-realtime e altri modelli di streaming in produzione su registrazioni telefoniche, parlato con accenti, condizioni rumorose e conferenze sui risultati finanziari, inclusi dati alfanumerici come numeri di telefono, email e UUID.
Rilevamento dei turni ai vertici della categoria, integrato. Ink-2 ha il rilevamento della fine del turno integrato nel modello, quindi non serve un modello separato per l'alternanza dei turni come Silero nel tuo stack. Meno dipendenze, latenza inferiore e alternanza dei turni più accurata.
Resistenza al rumore integrata. Ink-2 gestisce il rumore di fondo senza richiedere Krisp o altri filtri audio, eliminando costi e latenza dal tuo stack.
Mi servono ancora Krisp o Silero con Ink-2?
No. Questo è uno dei motivi principali per cui i team passano a Ink-2:
L'alternanza dei turni è integrata. La maggior parte dei modelli STT richiede un rilevatore di turni esterno, come Silero, per sapere quando l'utente ha finito di parlare. Ink-2 lo gestisce nativamente, in modo più veloce e accurato rispetto all'esecuzione di un modello separato.
La resistenza al rumore è integrata. La maggior parte degli agenti vocali aggiunge Krisp o filtri audio simili al proprio STT per rimuovere il rumore di fondo, aumentando costi, latenza e complessità. Ink-2 gestisce il rumore di fondo fin da subito.
Meno modelli nello stack significano latenza e costi inferiori e meno punti di errore.
Ink-2 può essere eseguito on-premise o nel mio cloud (VPC)?
Sì, Ink-2 può essere distribuito:
On-premise nel tuo data center, anche in ambienti isolati dalla rete
Nel tuo VPC su AWS, GCP o Azure
Tramite licenza OEM per integrare Ink-2 direttamente nel tuo prodotto
Questo rende Ink-2 adatto a contratti governativi, settori regolamentati come sanità, servizi finanziari e assicurazioni, e clienti con requisiti di sovranità o residenza dei dati. Le distribuzioni on-premise e OEM sono disponibili con contratti enterprise.
Quali lingue supporta Ink-2?
Ink-2 supporta inglese, spagnolo, francese, hindi e giapponese.
Quanto costa Ink-2?
Ink-2 costa 3 crediti al secondo. Dettagli sui prezzi e sconti per volume sono nella pagina dei prezzi su https://www.cartesia.ai/pricing. I contratti Enterprise includono prezzi personalizzati in base all'utilizzo e al modello di distribuzione.
Cartesia offre anche un programma di contributi per startup su https://www.cartesia.ai/startups con crediti per le aziende idonee nelle fasi iniziali.
Quando dovrei contattare il team commerciale?
Contatta il team Cartesia se ti trovi in una delle seguenti situazioni:
Gestisci carichi di produzione ad alto volume (>50 milioni di crediti)
Ti serve una distribuzione on-premise, VPC o OEM
Ti serve un BAA, conservazione dei dati pari a zero o altre condizioni contrattuali di conformità per sanità, servizi finanziari o settori regolamentati
Ti occupi di acquisti governativi, federali o del settore pubblico
Per tutto il resto, come valutazione, prototipazione e carichi di produzione più piccoli, puoi iniziare con i piani self-service e la documentazione tecnica su https://docs.cartesia.ai/build-with-cartesia/stt-models/latest.
Inizia oggi
Parla con un esperto.
Contatta un membro del nostro team e scopri come Cartesia può aiutarti a creare esperienze vocali di altissimo livello.
Inizia a sviluppare.
Accedi ai nostri modelli tramite API e porta un agente vocale in produzione in pochi minuti.





