Ink: il modello di trascrizione vocale più veloce e accurato

Al primo posto per precisione, progettato per agenti vocali con rilevamento semantico della fine del turno e latenza leader nel settore.

Questa demo di Ink 2 supporta inglese, spagnolo, francese, hindi e giapponese. Per questa demo, parla in inglese.

Fai clic o premi Space per avviare una trascrizione
Tocca per avviare una trascrizione
Ti serve un argomento?
Quale posto ti piacerebbe visitare un giorno?

Un modello di trascrizione per ogni ambiente in cui ti porta la tua attività

I treni passano rombando, gli annunci crepitano dagli altoparlanti. Ink-2 trascrive ogni parola del chiamante.

Città rumorosa

Illustrazione di una scena di strada in Mattina
Illustrazione di una scena di strada in Mezzogiorno
Illustrazione di una scena di strada in Notte
Illustrazione di una scena di strada in Mattina

Progettato per gli agenti vocali

Quattro funzionalità che rendono Ink il livello di trascrizione su cui si basano gli agenti in produzione.

Precisione

Capisce bene al primo tentativo.

In pratica

In un agente vocale, la trascrizione è la base su cui si costruisce tutto il resto. Un errore di trascrizione compromette l'input dell'LLM e porta l'interazione nella direzione sbagliata.

È altrettanto vero il contrario: l'accuratezza si amplifica e una trascrizione precisa significa una risposta migliore e una chiamata che si risolve.


L'approccio di Ink-2

Ink ha il Word Error Rate (WER) più basso di qualsiasi modello STT in streaming e gestisce nativamente dati strutturati come numeri di telefono, date, email, valute e UUID. Pensato per contesti audio reali: telefonia, rumore di fondo, accenti diversi e altro ancora.

Date, codici alfanumerici, ID

Fluidità della conversazione

Sa quando inizi e finisci.

In pratica

Una conversazione ha due momenti decisivi: quando un chiamante inizia a parlare e quando finisce. Se perde l'inizio, l'agente perde l'intero turno. Se reagisce troppo presto alla fine, interviene a metà pensiero. Il modello di trascrizione giusto riconosce entrambi senza attesa.


L'approccio di Ink-2

Ink-2 ha il rilevamento nativo dei turni: turn.start e turn.end vengono segnalati direttamente dal modello, senza un VAD esterno da integrare o mantenere. Per una latenza inferiore, turn.eager_end dà all'LLM un vantaggio prima che il turno sia confermato completo.

Il rilevamento semantico della fine del turno si basa sul significato, non sul silenzio, quindi le pause a metà pensiero non attivano l'agente prematuramente.

ink-2

10.1 s prima

Il tuo agente può rispondere prima ancora che il concorrente inizi

flux-general-en

15.9s

Solo ora l'agente sa che l'interlocutore ha finito e parte da zero

Velocità

Il chiamante smette di parlare.
L'agente inizia a pensare.

In pratica

Quando la trascrizione è veloce e costante, la risposta dell'agente sembra immediata. Una trascrizione lenta su dieci significa una chiamata su dieci in cui quella prontezza viene meno. Nove ottime chiamate non cancellano quella che non ha funzionato bene.


L'approccio di Ink-2

Ink è il modello ASR in streaming più veloce, basato su un motore di inferenza personalizzato progettato per conversazioni in tempo reale. Il tempo fino alla trascrizione finale è di 0,1 s, con turn.eager_end che riduce l'intervallo tra l'ultima parola e la prima risposta.

Ink
88ms
Un battito di ciglia
100ms
Soglia di risposta umana
150ms

Costo

Qualità che non costa di più quando cresci.

In pratica

La voce è l'interfaccia più naturale per comunicare. Il giusto equilibrio tra costo e qualità su larga scala permette di portare la voce ovunque, come interfaccia predefinita di ogni interazione con agenti.


L'approccio di Ink-2

L'architettura State Space Model di Ink offre un throughput 10-100 volte superiore ai transformer, con costi di calcolo inferiori su larga scala e senza compromessi sulla qualità. L'ottimizzazione continua del nostro stack di modelli migliora l'economia unitaria man mano che cresci.

Sicurezza di livello enterprise.Dal cloud al locale.

  • Badge Conforme a HIPAA

    Conforme a HIPAA

  • Badge SOC 2 Type 2

    SOC 2 Type 2

  • Badge GDPR

    GDPR

  • Badge PCI

    PCI

Domande frequenti

Perché Ink-2 è il miglior STT per gli agenti vocali?

Ink-2 è il modello di trascrizione vocale in streaming di Cartesia, progettato appositamente per agenti vocali in produzione. Come il nostro TTS, si basa sull'architettura State Space Model (SSM), sviluppata dal nostro team fondatore a Stanford, che permette a Ink-2 di offrire tre cose contemporaneamente:

Il WER più basso tra tutti i modelli STT in streaming. Ink-2 supera Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro, ElevenLabs Scribe-2-realtime e altri modelli di streaming in produzione su registrazioni telefoniche, parlato con accenti, condizioni rumorose e conferenze sui risultati finanziari, inclusi dati alfanumerici come numeri di telefono, email e UUID.

Rilevamento dei turni ai vertici della categoria, integrato. Ink-2 ha il rilevamento della fine del turno integrato nel modello, quindi non serve un modello separato per l'alternanza dei turni come Silero nel tuo stack. Meno dipendenze, latenza inferiore e alternanza dei turni più accurata.

Resistenza al rumore integrata. Ink-2 gestisce il rumore di fondo senza richiedere Krisp o altri filtri audio, eliminando costi e latenza dal tuo stack.

Mi servono ancora Krisp o Silero con Ink-2?

No. Questo è uno dei motivi principali per cui i team passano a Ink-2:

L'alternanza dei turni è integrata. La maggior parte dei modelli STT richiede un rilevatore di turni esterno, come Silero, per sapere quando l'utente ha finito di parlare. Ink-2 lo gestisce nativamente, in modo più veloce e accurato rispetto all'esecuzione di un modello separato.

La resistenza al rumore è integrata. La maggior parte degli agenti vocali aggiunge Krisp o filtri audio simili al proprio STT per rimuovere il rumore di fondo, aumentando costi, latenza e complessità. Ink-2 gestisce il rumore di fondo fin da subito.

Meno modelli nello stack significano latenza e costi inferiori e meno punti di errore.

Ink-2 può essere eseguito on-premise o nel mio cloud (VPC)?

Sì, Ink-2 può essere distribuito:

On-premise nel tuo data center, anche in ambienti isolati dalla rete

Nel tuo VPC su AWS, GCP o Azure

Tramite licenza OEM per integrare Ink-2 direttamente nel tuo prodotto

Questo rende Ink-2 adatto a contratti governativi, settori regolamentati come sanità, servizi finanziari e assicurazioni, e clienti con requisiti di sovranità o residenza dei dati. Le distribuzioni on-premise e OEM sono disponibili con contratti enterprise.

Quali lingue supporta Ink-2?

Ink-2 supporta inglese, spagnolo, francese, hindi e giapponese.

Quanto costa Ink-2?

Ink-2 costa 3 crediti al secondo. Dettagli sui prezzi e sconti per volume sono nella pagina dei prezzi su https://www.cartesia.ai/pricing. I contratti Enterprise includono prezzi personalizzati in base all'utilizzo e al modello di distribuzione.

Cartesia offre anche un programma di contributi per startup su https://www.cartesia.ai/startups con crediti per le aziende idonee nelle fasi iniziali.

Quando dovrei contattare il team commerciale?

Contatta il team Cartesia se ti trovi in una delle seguenti situazioni:

Gestisci carichi di produzione ad alto volume (>50 milioni di crediti)

Ti serve una distribuzione on-premise, VPC o OEM

Ti serve un BAA, conservazione dei dati pari a zero o altre condizioni contrattuali di conformità per sanità, servizi finanziari o settori regolamentati

Ti occupi di acquisti governativi, federali o del settore pubblico

Per tutto il resto, come valutazione, prototipazione e carichi di produzione più piccoli, puoi iniziare con i piani self-service e la documentazione tecnica su https://docs.cartesia.ai/build-with-cartesia/stt-models/latest.

Inizia oggi

Parla con un esperto.

Contatta un membro del nostro team e scopri come Cartesia può aiutarti a creare esperienze vocali di altissimo livello.

Contatta il team commerciale

Inizia a sviluppare.

Accedi ai nostri modelli tramite API e porta un agente vocale in produzione in pochi minuti.

Prova Cartesia