Alcuni acquirenti non possono usare un’API vocale ospitata, a nessun prezzo. Enti pubblici, ospedali, banche e fornitori della difesa acquistano IA vocale a una condizione: l’audio resta nel nostro perimetro. L’IA vocale on-premise soddisfa questa condizione e cambia ciò che devi valutare prima dell’acquisto.
Questa pagina spiega cos’è l’IA vocale on-premise, cosa deve effettivamente girare sul tuo hardware, dove si colloca tra API cloud e isolamento completo dalla rete e come valutare i fornitori. Infine descrive l’approccio di Cartesia, inclusa la distribuzione on-prem completamente air-gapped alla base degli AI Voice Agents di ServiceNow.
Cos’è l’IA vocale on-premise?
È software vocale eseguito su infrastruttura posseduta e controllata dalla tua organizzazione. Il fornitore consegna i modelli; il tuo team li esegue sui propri server, nel proprio data center o in un account cloud di cui controlla le chiavi. Nessun elemento di una chiamata dal vivo, né audio né trascrizione, deve passare dall’infrastruttura del fornitore.
L’alternativa abituale è un’API cloud: trasmetti l’audio al fornitore, che esegue i modelli, mentre audio e trascrizioni sono soggetti alle sue condizioni di servizio. Questo compromesso va bene per molti prodotti e non per altri. Se l’audio è un briefing classificato, una seduta terapeutica o una chiamata di cui un’autorità può richiedere copia, “il fornitore dice di cancellarlo” non è sempre una risposta accettabile.
Qui “IA vocale” indica una pipeline vocale in tempo reale. Un agente costruito su di essa ha quattro componenti:
| Componente | Cosa fa | Può girare on-prem? |
|---|---|---|
| Trascrizione vocale in streaming | Trascrive mentre chi chiama sta ancora parlando | Sì |
| Rilevamento dei turni | Decide quando chi chiama ha finito | Sì |
| Modello linguistico e strumenti | Elabora la risposta e chiama i tuoi sistemi | Sì, a tua scelta |
| Sintesi vocale in streaming | Pronuncia la risposta mentre viene ancora generata | Sì |
Tutte possono girare nel tuo perimetro. Il modello linguistico è sempre stato una tua scelta; le parti che i fornitori in genere tengono per sé sono i modelli vocali. La possibilità di portarli all’interno è una differenza concreta tra fornitori.
Perché le aziende distribuiscono l’IA vocale on-prem
Tre ragioni ricorrono spesso:
Sovranità e residenza dei dati. Alcuni contratti e ordinamenti richiedono che certi dati non escano mai da un confine fisico o giuridico sotto il tuo controllo. Un’API cloud invia l’audio a chi la gestisce; l’on-prem mantiene il confine nel tuo rack.
Conformità. Gli acquirenti regolamentati collegano le distribuzioni a quadri come HIPAA, GDPR e PCI. L’on-prem da solo non rende conformi, ma rende verificabile il percorso: i dati partono e arrivano in un’infrastruttura che puoi mostrare a un revisore.
Latenza e controllo. Quando i modelli girano nella tua rete, elimini un viaggio di andata e ritorno al fornitore e non erediti i suoi limiti di frequenza. Per un agente vocale, il tempo di risposta è il prodotto. Le persone si passano la parola in circa 200 millisecondi (Stivers et al., 2009) e un secondo di silenzio sembra esitazione. Per questo esiste anche l’estremo di questo spettro, eseguire i modelli sul dispositivo: nessuna rete, nessuna infrastruttura condivisa.
Lo spettro delle distribuzioni
“Cloud o on-prem” è in realtà uno spettro di chi gestisce cosa. La maggior parte delle implementazioni aziendali rientra in una di queste opzioni:
| Distribuzione | Dove girano i modelli | Chi li gestisce | Percorso dei dati |
|---|---|---|---|
| API cloud | Cloud del fornitore | Fornitore | L’audio esce dalla tua rete |
| VPC, cloud privato | Tuo account cloud, tua regione | Tu, con supporto del fornitore | L’audio resta nel tuo account cloud |
| On-premise | Tuo data center | Tu | L’audio resta nella tua rete |
| On-prem air-gapped | Tuo data center, senza percorso internet | Tu | Nulla esce, per costruzione |
| Sul dispositivo | L’endpoint stesso | Tu | Nulla esce dall’hardware |
Due note fanno risparmiare tempo. Primo, VPC non è on-prem: l’hardware è tuo, il data center no. In genere basta se il vincolo è contrattuale. Secondo, chiedi a ogni fornitore cosa includa nel termine “on-prem”. Alcuni intendono un container che esegui tu ma che contatta ancora il fornitore per licenze o aggiornamenti. È on-prem connesso e non soddisfa requisiti air-gapped.
Come valutare un fornitore di IA vocale on-prem
Le domande che distinguono offerte reali da promesse commerciali:
- L’isolamento è reale? L’inferenza può funzionare senza connettività in uscita, oppure licenze, telemetria o chiamate cloud obbligatorie lasciano la rete durante la conversazione?
- I modelli on-prem sono gli stessi del cloud? Alcuni fornitori consegnano un modello diverso e più vecchio di quello dell’API. Se le demo apprezzate usavano il modello cloud, chiedi quale binario stai acquistando.
- Quale latenza ottieni nel tuo ambiente? I numeri del fornitore sono misurati sul suo hardware. Chiedi un benchmark sul tuo, con la tua concorrenza, al 99° percentile anziché alla mediana.
- Chi aggiorna i modelli e come? On-prem non dovrebbe significare immobile. Chiedi come arrivano gli aggiornamenti, se puoi fissare le versioni e cosa comporta cambiare modello per prompt e voci già configurati.
- Quali documenti di conformità sono disponibili? SOC 2 Type II, un BAA firmabile, un DPA pubblicato e condizioni di residenza dei dati. Se il fornitore non li produce, il modello di distribuzione non salverà l’accordo.
- L’intera pipeline entra nel perimetro? Un TTS on-prem accanto a un STT che non lo è lascia una falla nella distribuzione. Chiedi informazioni sull’intera pipeline, incluso il rilevamento dei turni.
Come Cartesia gestisce l’on-prem
I modelli Cartesia si basano sui modelli a spazio di stato, un’architettura progettata per l’inferenza in tempo reale. Gli stessi modelli sono disponibili nel cloud, on-premise e sul dispositivo. In concreto:
- Sonic, il nostro modello TTS, con latenza del modello inferiore a 90 ms, primo nei test ciechi di ascolto di terze parti e 44 lingue, si distribuisce nel tuo data center, anche air-gapped, nel tuo VPC su AWS, GCP o Azure, oppure tramite licenza OEM per integrarlo direttamente nel prodotto.
- Ink, il nostro modello di trascrizione in streaming con rilevamento nativo dei turni, offre le stesse opzioni.
- Per gli AI Voice Agents di ServiceNow, Cartesia fornisce modelli vocali, motore di inferenza e orchestrazione come distribuzione on-prem completamente air-gapped, insieme alla conformità SOC 2 Type II, HIPAA, GDPR e PCI.
- Rasa include le opzioni on-premise di Cartesia nella propria offerta enterprise e Blue Machines ha sviluppato con noi un’architettura di distribuzione per ambienti regolamentati.
- All’estremo dello spettro, Edge è la nostra libreria open source, Apache 2.0, per eseguire modelli a spazio di stato sul dispositivo.
Le distribuzioni on-prem e OEM sono disponibili con contratti enterprise. Parlaci dei tuoi requisiti oppure parti dal cloud con prezzi self-service e spostati all’interno in seguito. Poiché i modelli sono gli stessi, il passaggio cambia la distribuzione e non richiede una ricostruzione.