Impara

IA vocale on-premise: cos'è e come funziona

Rene, Kabir Goel 
IA vocale on-premise: cos'è e come funziona

Alcuni acquirenti non possono usare un’API vocale ospitata, a nessun prezzo. Enti pubblici, ospedali, banche e fornitori della difesa acquistano IA vocale a una condizione: l’audio resta nel nostro perimetro. L’IA vocale on-premise soddisfa questa condizione e cambia ciò che devi valutare prima dell’acquisto.

Questa pagina spiega cos’è l’IA vocale on-premise, cosa deve effettivamente girare sul tuo hardware, dove si colloca tra API cloud e isolamento completo dalla rete e come valutare i fornitori. Infine descrive l’approccio di Cartesia, inclusa la distribuzione on-prem completamente air-gapped alla base degli AI Voice Agents di ServiceNow.

Cos’è l’IA vocale on-premise?

È software vocale eseguito su infrastruttura posseduta e controllata dalla tua organizzazione. Il fornitore consegna i modelli; il tuo team li esegue sui propri server, nel proprio data center o in un account cloud di cui controlla le chiavi. Nessun elemento di una chiamata dal vivo, né audio né trascrizione, deve passare dall’infrastruttura del fornitore.

L’alternativa abituale è un’API cloud: trasmetti l’audio al fornitore, che esegue i modelli, mentre audio e trascrizioni sono soggetti alle sue condizioni di servizio. Questo compromesso va bene per molti prodotti e non per altri. Se l’audio è un briefing classificato, una seduta terapeutica o una chiamata di cui un’autorità può richiedere copia, “il fornitore dice di cancellarlo” non è sempre una risposta accettabile.

Qui “IA vocale” indica una pipeline vocale in tempo reale. Un agente costruito su di essa ha quattro componenti:

ComponenteCosa faPuò girare on-prem?
Trascrizione vocale in streamingTrascrive mentre chi chiama sta ancora parlandoSì
Rilevamento dei turniDecide quando chi chiama ha finitoSì
Modello linguistico e strumentiElabora la risposta e chiama i tuoi sistemiSì, a tua scelta
Sintesi vocale in streamingPronuncia la risposta mentre viene ancora generataSì

Tutte possono girare nel tuo perimetro. Il modello linguistico è sempre stato una tua scelta; le parti che i fornitori in genere tengono per sé sono i modelli vocali. La possibilità di portarli all’interno è una differenza concreta tra fornitori.

Perché le aziende distribuiscono l’IA vocale on-prem

Tre ragioni ricorrono spesso:

Sovranità e residenza dei dati. Alcuni contratti e ordinamenti richiedono che certi dati non escano mai da un confine fisico o giuridico sotto il tuo controllo. Un’API cloud invia l’audio a chi la gestisce; l’on-prem mantiene il confine nel tuo rack.

Conformità. Gli acquirenti regolamentati collegano le distribuzioni a quadri come HIPAA, GDPR e PCI. L’on-prem da solo non rende conformi, ma rende verificabile il percorso: i dati partono e arrivano in un’infrastruttura che puoi mostrare a un revisore.

Latenza e controllo. Quando i modelli girano nella tua rete, elimini un viaggio di andata e ritorno al fornitore e non erediti i suoi limiti di frequenza. Per un agente vocale, il tempo di risposta è il prodotto. Le persone si passano la parola in circa 200 millisecondi (Stivers et al., 2009) e un secondo di silenzio sembra esitazione. Per questo esiste anche l’estremo di questo spettro, eseguire i modelli sul dispositivo: nessuna rete, nessuna infrastruttura condivisa.

Lo spettro delle distribuzioni

“Cloud o on-prem” è in realtà uno spettro di chi gestisce cosa. La maggior parte delle implementazioni aziendali rientra in una di queste opzioni:

DistribuzioneDove girano i modelliChi li gestiscePercorso dei dati
API cloudCloud del fornitoreFornitoreL’audio esce dalla tua rete
VPC, cloud privatoTuo account cloud, tua regioneTu, con supporto del fornitoreL’audio resta nel tuo account cloud
On-premiseTuo data centerTuL’audio resta nella tua rete
On-prem air-gappedTuo data center, senza percorso internetTuNulla esce, per costruzione
Sul dispositivoL’endpoint stessoTuNulla esce dall’hardware

Due note fanno risparmiare tempo. Primo, VPC non è on-prem: l’hardware è tuo, il data center no. In genere basta se il vincolo è contrattuale. Secondo, chiedi a ogni fornitore cosa includa nel termine “on-prem”. Alcuni intendono un container che esegui tu ma che contatta ancora il fornitore per licenze o aggiornamenti. È on-prem connesso e non soddisfa requisiti air-gapped.

Come valutare un fornitore di IA vocale on-prem

Le domande che distinguono offerte reali da promesse commerciali:

  1. L’isolamento è reale? L’inferenza può funzionare senza connettività in uscita, oppure licenze, telemetria o chiamate cloud obbligatorie lasciano la rete durante la conversazione?
  2. I modelli on-prem sono gli stessi del cloud? Alcuni fornitori consegnano un modello diverso e più vecchio di quello dell’API. Se le demo apprezzate usavano il modello cloud, chiedi quale binario stai acquistando.
  3. Quale latenza ottieni nel tuo ambiente? I numeri del fornitore sono misurati sul suo hardware. Chiedi un benchmark sul tuo, con la tua concorrenza, al 99° percentile anziché alla mediana.
  4. Chi aggiorna i modelli e come? On-prem non dovrebbe significare immobile. Chiedi come arrivano gli aggiornamenti, se puoi fissare le versioni e cosa comporta cambiare modello per prompt e voci già configurati.
  5. Quali documenti di conformità sono disponibili? SOC 2 Type II, un BAA firmabile, un DPA pubblicato e condizioni di residenza dei dati. Se il fornitore non li produce, il modello di distribuzione non salverà l’accordo.
  6. L’intera pipeline entra nel perimetro? Un TTS on-prem accanto a un STT che non lo è lascia una falla nella distribuzione. Chiedi informazioni sull’intera pipeline, incluso il rilevamento dei turni.

Come Cartesia gestisce l’on-prem

I modelli Cartesia si basano sui modelli a spazio di stato, un’architettura progettata per l’inferenza in tempo reale. Gli stessi modelli sono disponibili nel cloud, on-premise e sul dispositivo. In concreto:

  • Sonic, il nostro modello TTS, con latenza del modello inferiore a 90 ms, primo nei test ciechi di ascolto di terze parti e 44 lingue, si distribuisce nel tuo data center, anche air-gapped, nel tuo VPC su AWS, GCP o Azure, oppure tramite licenza OEM per integrarlo direttamente nel prodotto.
  • Ink, il nostro modello di trascrizione in streaming con rilevamento nativo dei turni, offre le stesse opzioni.
  • Per gli AI Voice Agents di ServiceNow, Cartesia fornisce modelli vocali, motore di inferenza e orchestrazione come distribuzione on-prem completamente air-gapped, insieme alla conformità SOC 2 Type II, HIPAA, GDPR e PCI.
  • Rasa include le opzioni on-premise di Cartesia nella propria offerta enterprise e Blue Machines ha sviluppato con noi un’architettura di distribuzione per ambienti regolamentati.
  • All’estremo dello spettro, Edge è la nostra libreria open source, Apache 2.0, per eseguire modelli a spazio di stato sul dispositivo.

Le distribuzioni on-prem e OEM sono disponibili con contratti enterprise. Parlaci dei tuoi requisiti oppure parti dal cloud con prezzi self-service e spostati all’interno in seguito. Poiché i modelli sono gli stessi, il passaggio cambia la distribuzione e non richiede una ricostruzione.

Domande frequenti

Cos'è l'IA vocale on-premise?

È software vocale eseguito su hardware controllato dalla tua organizzazione, all'interno della tua rete. Riconoscimento vocale, sintesi vocale e modelli che decidono cosa dire operano nel tuo data center o cloud privato, quindi audio e trascrizioni delle chiamate non passano mai dai server del fornitore.

On-prem equivale ad air-gapped?

No. On-prem significa che il software gira sul tuo hardware. Air-gapped significa che non esiste alcun percorso verso internet pubblico. On-prem indica il luogo di distribuzione; air-gapped è la politica di rete più restrittiva applicabile. Le organizzazioni con requisiti di sovranità di solito intendono air-gapped quando chiedono on-prem.

La sintesi vocale può funzionare on-premise?

Sì. Sonic, il modello TTS di Cartesia, può essere distribuito nel tuo data center, anche in ambienti air-gapped, o nel tuo VPC su AWS, GCP o Azure. Lo stesso vale per Ink, il modello di trascrizione vocale in streaming di Cartesia. Entrambi sono disponibili con contratti enterprise.

Quali certificazioni di conformità contano per l'IA vocale?

Cerca SOC 2 Type II, idoneità HIPAA con BAA firmato e conformità GDPR, e chiedi come il fornitore gestisce la conservazione dei dati. Cartesia è certificata SOC 2 Type II, idonea HIPAA con BAA disponibili, conforme al GDPR e offre conservazione zero dei dati per i servizi idonei. Il suo Data Protection Addendum è pubblicato su cartesia.ai/legal/dpa.

Serve una distribuzione interamente on-prem per mantenere privato l'audio?

Non sempre. Se il vincolo è contrattuale anziché fisico, un VPC o la conservazione zero dei dati possono soddisfarlo con meno oneri operativi. L'on-premise giustifica il costo quando l'audio non deve fisicamente uscire dal perimetro, oppure quando lo richiedono un'autorità o un contratto.