Un agente vocale IA risponde al telefono, ascolta ciò che vuole chi chiama e interviene: prenota un appuntamento, controlla un ordine, risponde a una domanda o passa a una persona prima che l’interlocutore resti bloccato. I chatbot svolgono questo lavoro leggendo e scrivendo. Un agente vocale lo fa su audio dal vivo, mentre chi chiama sta ancora parlando.
Questa differenza nei tempi costituisce gran parte del lavoro ingegneristico. La pagina spiega cos’è un agente vocale, come funziona la pipeline, cosa rende difficile costruirlo e i due modi per farlo su Cartesia.
Cos’è un agente vocale IA?
Un agente vocale è software che sostiene una conversazione parlata e compie azioni. Trascrive ciò che dice chi chiama, decide cosa fare, chiama strumenti come un calendario o un sistema ordini e pronuncia il risultato. L‘“IA conversazionale” è la categoria più ampia; un agente vocale la applica al parlato in tempo reale. Per la categoria nel suo insieme abbiamo una panoramica dell’IA conversazionale separata.
Viene confuso con due sistemi vicini:
| Sistema | Cosa fa | Perché è diverso |
|---|---|---|
| IVR a toni o menu | Riproduce menu e instrada chiamate | Non comprende il linguaggio; è chi chiama ad adattarsi al menu |
| Chatbot testuale | Legge e scrive testo | Non ha audio dal vivo e può fermarsi tra i turni senza che chi chiama lo noti |
Un agente vocale può capire una richiesta che i menu non prevedevano e deve rispondere mentre l’interlocutore è ancora in linea. Se sbaglia i tempi, le persone gli parlano sopra, aspettano durante pause innaturali o riagganciano.
Come funziona un agente vocale
Il ciclo ha quattro fasi, che nei sistemi migliori lavorano in parallelo anziché una dopo l’altra:
| Fase | Compito | Cosa osservare |
|---|---|---|
| Trascrizione vocale in streaming | Trascrivere l’audio mentre arriva | Accuratezza su accenti, codec telefonici e rumore; non eliminare il silenzio necessario al rilevamento dei turni |
| Rilevamento dei turni | Decidere quando chi chiama ha completato il pensiero | Una pausa può significare “sto pensando” o “ho finito”; un timeout fisso tratta i due casi allo stesso modo |
| LLM e strumenti | Pianificare la risposta, chiamare calendario o sistema ordini | La latenza degli strumenti entra direttamente nell’attesa dell’interlocutore |
| Sintesi vocale | Pronunciare la risposta trasmettendola mentre viene generata | Iniziare prima che esista la frase completa e gestire correttamente le interruzioni |
Chi chiama percepisce un solo numero: il tempo tra la fine della frase e l’inizio della risposta. Ogni fase contribuisce. Un TTS sotto il secondo non salva un agente le cui chiamate agli strumenti richiedono tre secondi, e un LLM veloce non salva un riconoscitore che trascrive male il numero di conto. Misura l’intero ciclo. Ink di Cartesia gestisce le prime due fasi in un modello, con trascrizione in streaming e rilevamento nativo dei turni. Sonic è la quarta fase, un modello TTS al primo posto nei test ciechi di ascolto, con latenza del modello inferiore a 90 ms e oltre 40 lingue. Il modello linguistico al centro lo scegli tu.
Cosa rende difficili gli agenti vocali
La pipeline è la parte facile. Gli agenti cedono soprattutto su tre comportamenti:
Gestione dei turni. Le persone non parlano per frasi complete. Dicono “il mio indirizzo è…” e si fermano per cercarlo. Studi sulle conversazioni in più lingue mostrano che ci si passa la parola in circa 200 millisecondi (Stivers et al., 2009). Un agente che aspetta un secondo intero per essere sicuro ha già perso il ritmo, mentre uno che interviene a ogni pausa interrompe. Capire se la pausa significa “sto pensando” o “ho finito” è un problema autonomo; lo trattiamo nella guida al rilevamento dell’attività vocale e dei turni.
Interruzioni. Chi chiama cambia idea durante la risposta: “anzi, facciamo giovedì”. Un agente utile smette di parlare, recepisce la correzione e continua. Significa annullare anche l’audio già nel buffer dell’altoparlante, oltre alla generazione testuale. È un problema del client tanto quanto del server.
Recupero. Il riconoscitore sentirà male. Una chiamata a uno strumento andrà in timeout. L’agente deve avere una mossa successiva: chiedere una conferma, riprovare o trasferire a una persona prima che l’interlocutore ripeta per la terza volta. Gli agenti che sanno solo riuscire falliscono in modo evidente.
Valuta sulle tue chiamate, non su una demo
La demo di ogni fornitore funziona perché è stata scritta per la demo. Chi ti chiama ha i propri accenti, la tua connessione telefonica e la tua terminologia. Prima di instradare traffico reale, esegui un lotto di chiamate registrate o di prova e valuta la conversazione:
- Lascia finire chi chiama, comprese aggiunte come “e, ehm, il secondo”?
- Inizia a rispondere prontamente dopo risposte complete, senza un secondo vuoto?
- Quando chi chiama interrompe, l’audio si ferma davvero?
- Quando capisce male, conferma o trasferisce invece di indovinare?
- Prima di azioni con conseguenze, come annullare una prenotazione o modificare un ordine, chiede conferma?
La guida al progetto pilota per call center IA trasforma questi criteri in una scheda di valutazione per una coda di assistenza. La guida al receptionist IA include una tabella di test di accettazione con un caso di prompt injection.
Due modi per costruirlo su Cartesia
Managed Agents (/agents) collega il ciclo per te. Scegli l’LLM, collega strumenti e trasferimenti, aggiungi una base di conoscenza e ottieni un numero telefonico in pochi clic. Cartesia gestisce lo stack di streaming sottostante. È il percorso rapido da “nulla” a “agente verificabile”.
L’API ti fornisce i componenti. Sonic per il parlato, Ink per trascrizione in streaming e rilevamento dei turni, il tuo LLM al centro e il tuo codice a controllare il ciclo. Usala quando devi controllare modello, linguaggio di implementazione o distribuzione. L’introduzione a Managed Agents nella documentazione copre entrambi i percorsi e ciò che gestiscono per te.
Entrambi usano gli stessi modelli. Si basano sull’architettura State Space Model, che rende praticabile lo streaming con queste latenze, ma non devi occupartene finché non ti occupi della fattura.
Dove si usano gli agenti vocali
Assistenza clienti e help desk, reception e appuntamenti, automazione dei call center ed esperienze interattive come personaggi e giocattoli. Decagon, ServiceNow, Quora, Retell ed EliseAI costruiscono prodotti vocali con Cartesia; la pagina clienti riporta i dettagli.