Blog / Prodotto

Guida introduttiva alla terminologia dell'IA vocale

Zubin Pratap 
Sei studi verdi ad acquerello, ciascuno con blocchi dipinti e un rettangolo dal contorno disegnato a mano in una diversa disposizione

I concetti di IA vocale da conoscere

Quando il tuo agente interrompe l’utente al momento sbagliato, è un problema di trascrizione vocale, STT? Di rilevamento dell’attività vocale, VAD? Oppure il modello di sintesi vocale non è stato fermato durante la generazione?

Sono tre cose diverse, con correzioni diverse, in punti diversi della pipeline.

Ecco perché costruire agenti davvero conversazionali è molto più difficile che scegliere un modello STT o TTS.

In Cartesia costruiamo IA che aiuti le persone a esprimersi ed essere comprese.

La comprensione inizia da un vocabolario comune.

Questo articolo ti dà i termini per capire, esplorare e ragionare sugli agenti conversazionali e leggere i risultati dei benchmark che sembrano uscire ogni pochi giorni.

Li ho raggruppati in sezioni per dare contesto. Il contesto è tutto, soprattutto nell’IA.

La pipeline vocale di base

  1. STT, Speech-to-Text. Converte il parlato in ingresso in testo. Nella pratica, STT e ASR, riconoscimento vocale automatico, sono spesso usati come sinonimi.

    Ogni volta che detti un messaggio al telefono usi STT o ASR.

    Nell’IA vocale conversazionale, una conversazione naturale bidirezionale tra persona e IA, è l’unico canale di comunicazione dalla persona al sistema, ma è solo una parte del sistema.

    Puoi provare gratuitamente i modelli STT Cartesia, chiamati Ink, qui. Mettili alla prova con numeri di telefono, date e indirizzi email scanditi lettera per lettera.

  2. VAD, Voice Activity Detection. I modelli VAD sono classificatori specializzati, diversi dal modello di trascrizione STT. Distinguono:

    1. Il silenzio dai suoni nel segnale in ingresso.

    2. Il parlato dai suoni di fondo.

      Filtrano il segnale audio per isolare il parlato, che poi inviano al modello ASR per la trascrizione.

    Il più recente modello STT Ink-2 gestisce internamente il rilevamento dei turni. Questo semplifica le pipeline perché non devi valutare, integrare e mantenere una VAD separata solo per capire quando l’utente parla.

  3. Rilevamento dei turni. È spesso chiamato endpointing, termine che può confondersi con gli endpoint API. Qui lo chiamiamo rilevamento dei turni.

    È la capacità di riconoscere se chi chiama ha iniziato, finito o ripreso il proprio turno. È più difficile di quanto sembri: una persona potrebbe fare una pausa, pensare, distrarsi per un momento o prendere un lungo respiro.

    È essenziale per l’esperienza utente. Un modello troppo rapido nel presumere che la persona abbia finito la interrompe; uno lento e impreciso aggiunge millisecondi preziosi alla latenza e produce conversazioni innaturali piene di vuoti.

    Una VAD inaffidabile combinata con un fine turno troppo anticipato può far sembrare l’IA incapace di lasciar parlare l’utente.

    Un rilevamento debole distrugge il flusso naturale e può causare errori di trascrizione che si accumulano e danneggiano le azioni successive della pipeline.

    Storicamente, VAD e sistemi di rilevamento dei turni usavano segnali indiretti come la durata delle pause. Modelli recenti come Ink-2 integrano invece questa capacità nel modello.

  4. TTS, Text-to-Speech. È l’opposto di STT: converte il testo in parlato sintetico. Può avere aspetti molto più soggettivi della trascrizione, come vedremo.

    Esiste da decenni. Un tempo suonava robotico, ma oggi i buoni modelli sono molto naturali. Puoi provare gratuitamente i nostri modelli TTS Sonic qui.

Funzionalità dell’IA vocale conversazionale

  1. Barge-in. È la gestione delle interruzioni ed è molto importante nell’IA conversazionale.

    Un sistema aziendale richiede molto più che collegare STT e TTS a un chatbot. Deve gestire conversazioni umane disordinate, imprevedibili e variabili per ambiente, regione e qualità.

    Il barge-in permette all’utente di interrompere l’IA e farla smettere di parlare. Il modello TTS deve sapere che l’utente ha iniziato o ripreso a parlare, un evento rilevato a monte da STT o VAD.

    Serve più del rilevamento dei turni: occorre progettare bene modelli e sistema che li orchestra.

    Il rilevamento dei turni STT emette un evento di inizio o ripresa del parlato, e l’orchestrazione deve silenziare immediatamente il flusso TTS. Non è banale, ma è possibile con modelli e orchestrazione ben progettati.

    In Cartesia usiamo un’architettura a eventi per orchestrare gli agenti vocali, così il sistema può osservare ogni evento e rispondere nel modo adatto.

  2. Isolamento della voce e riduzione del rumore. Alcuni modelli riducono il rumore ambientale o isolano la conversazione attiva da quelle di fondo. Conta quando l’agente viene usato in uffici, bar, aeroporti, call center, ospedali e altri luoghi affollati. È un problema difficile e i modelli hanno capacità diverse. Abbiamo dedicato particolare attenzione a questo aspetto in Ink-2 ASR, perché gli usi aziendali avvengono spesso con rumore ambientale, lontano da uno studio di registrazione.

Caratteristiche della voce

Le caratteristiche vocali contano, ma sono molto soggettive. Se tu e il tuo migliore amico non siete d’accordo sulla bellezza della voce di un attore, dipende da questa soggettività.

Ecco esempi di voci più o meno adatte per tono ed espressione emotiva. Le registrazioni mantengono la lingua originale.

Buona prosodia

Prosodia piatta

Espressione emotiva naturale

Espressione emotiva eccessiva

Le caratteristiche indesiderate sono spesso più facili da riconoscere di quelle desiderate. Prestando attenzione, percepiamo quando un attributo è troppo o troppo poco presente e decidiamo se la voce è adatta allo scopo.

  1. Prosodia. Comprende altezza e intonazione, volume, durata, tempi e ritmo: il “come” del parlato. È un insieme di attributi e caratteristiche tecniche usati per analizzare una voce.

    Volume e tempi sono intuitivi; vale la pena chiarire l’intonazione.

    Indica come la voce sale e scende. Spesso ci dice se una frase è una domanda o un’affermazione, una continuazione o una chiusura, enfatica o neutra. Un’altezza crescente alla fine segnala generalmente una domanda.

    La prosodia arricchisce le parole di significato e impatto. Immagina le reazioni diverse, in un’indagine scolastica, a “Johnny ha morso il cane?” e “Johnny ha morso il cane!”.

  2. Espressione emotiva. È legata alla prosodia perché ne è l’effetto. La prosodia trasmette emozione e significato e le persone sono molto sensibili a riconoscere e classificare l’emozione nella voce. Nei sistemi IA, l’emotività deve essere coerente con il caso d’uso.

  3. Timbro. È la qualità tonale del suono. Per la voce, spesso lo descriviamo con aggettivi: un conduttore radio può avere una voce calda e ricca o scura e vellutata; un cantante può essere nasale o rauco. Il timbro dà identità, risonanza emotiva, autorevolezza, fiducia e altre qualità.

  4. Velocità e ritmo. Non conta solo quante parole al minuto riesce a rappare Eminem. Conta anche la cadenza complessiva e la posizione e durata delle pause. Un buon ritmo rende l’audio facile da seguire, con pause che si allineano naturalmente alla punteggiatura.

  5. Vocal fry. Questa vibrazione scricchiolante a bassa frequenza si verifica quando l’aria pulsa lentamente attraverso le corde vocali. Aiuta il realismo perché le persone la producono naturalmente alla fine delle frasi.

    Per l’IA è un equilibrio delicato. L’ASR può scambiarla per rumore di fondo o silenzio. Nell’addestramento TTS, una quantità eccessiva diventa rumore e produce modelli con artefatti.

    L’obiettivo è un equilibrio naturale: abbastanza da non sembrare robotici, ma non tanto da confondere la voce o ridurre l’intelligibilità.

  6. Localizzazione, dialetti e pronuncia. Un TTS efficace deve suonare locale per ispirare fiducia. Non basta l’accento: serve normalizzazione, cioè interpretare correttamente abbreviazioni, date e valute secondo la regione. Per esempio, capire se “12/01” significa 12 gennaio o 1 dicembre, oppure se “Sr.” significa “Senior” o “Señor”.

    La normalizzazione è il livello semantico. C’è anche quello fonetico: accento, pronuncia e chiarezza. Un modello può normalizzare correttamente e suonare comunque sbagliato a Mumbai o Dublino. Nomi propri, marchi o termini tecnici pronunciati male rompono l’identità del marchio e riducono la fiducia.

    Un agente di qualità deve fare bene entrambe le cose, contenuto e suono, per il pubblico specifico. Per esempio:

  7. Backchanneling. Sono i piccoli segnali verbali con cui mostriamo di seguire una conversazione: “mm-hmm”, “giusto”, “capito”, “sì”.

    Non sono turni conversazionali, ma conferme e piccoli segnali.

    Nell’IA funzionano in due direzioni: il TTS deve produrli al momento giusto per non sembrare robotico e distaccato; l’ASR deve interpretarli come segnali di ascolto, non come interruzioni.

    Un agente che scambia “mm-hmm” per un’interruzione, o non dà mai segni di ascolto, sembra guasto anche se il sistema funziona correttamente.

Metriche delle prestazioni

  1. Aderenza al testo. Misura quanto il parlato TTS sia fedele al testo in ingresso. Anche modelli avanzati possono allucinare, aggiungendo parole assenti, o omettere intere frasi. L’accuratezza considera anche se il modello articola male o produce pronunce insolite che si discostano dal testo previsto.

    Senza alta fedeltà non si può usare un modello per letture legali o mediche, dove la precisione semantica è essenziale.

  2. Gestione alfanumerica. Misura l’affidabilità nel pronunciare dati fuori dal dizionario: numeri di telefono, codici di tracciamento, date e indirizzi email.

    Si basa sulla normalizzazione. Prima il modello interpreta il formato, per esempio MM-DD o DD-MM per “12/01”, poi lo pronuncia correttamente. Leggere un numero di telefono come un grande intero invece che cifra per cifra è sgradevole, soprattutto in contesti professionali o delicati come sanità, finanza e logistica.

  3. RTF, Real-Time Factor. Nella trascrizione STT misura la velocità del modello nel generare testo da una certa durata audio. Si divide il tempo di elaborazione per la durata dell’audio in ingresso.

    Se l’IA impiega 30 secondi a trascrivere 1 minuto, cioè 60 secondi, l’RTF è 0.5: più veloce del tempo reale. Con RTF uguale a 1, elaborazione e audio durano uguale. Sopra 1, l’STT resta indietro perché è più lento del tempo reale.

    Per TTS è leggermente diverso: misura il tempo necessario per generare audio dal testo.

STT/ASRTTS
Ingresso audio, uscita testo.Ingresso testo, uscita audio.
RTF = tempo di trascrizione / durata dell’audio in ingressoRTF = tempo di sintesi / durata del parlato generato
  1. TTFS, Time To Final Segment. Per un agente in conversazione dal vivo, l’RTF dell’ASR non è abbastanza dettagliato.

    Conta il tempo fino al segmento finale, TTFS, chiamato anche tempo fino alla trascrizione completa, TTCT. Misura il divario tra quando l’utente finisce il turno e quando STT produce la trascrizione definitiva, completa e pronta per l’LLM.

    È diverso dall’altro TTFS, Time to First Segment, che misura l’arrivo del primo blocco di testo. TTCT misura il completamento dell’intera trascrizione. Per un agente conversazionale il segmento finale è il punto di passaggio significativo, perché nulla a valle può agire finché TTCT non è completato.

  2. TTFB, Time to First Byte. Misura la reattività del TTS: il tempo tra l’arrivo del testo e l’inizio dello streaming dei primi byte audio.

    Un TTFB sotto 300ms era il riferimento per conversazioni naturali; oltre, compare il ritardo da walkie-talkie.

    In Cartesia siamo andati oltre: i modelli Sonic 3 arrivano da 40ms a 90ms, meno di un battito di palpebre umano, circa 100ms.

    Questo rende concreto il tempo reale.

  3. MOS, Mean Opinion Score. Esiste perché la qualità percepita della voce, naturalezza, affidabilità e adeguatezza, ha una forte componente soggettiva. Una voce adatta alla meditazione può essere sbagliata nel triage medico. Tradizionalmente valutato da gruppi di ascoltatori, oggi viene spesso previsto anche da modelli IA.

    È il punteggio medio da 1 a 5 assegnato dagli ascoltatori. Struttura la soggettività e valuta la voce rispetto alle aspettative e preferenze del pubblico previsto.

    Offre quindi un quadro per valutare il modello nel contesto e nel caso d’uso esatti del pubblico. È particolarmente rilevante per l’IA conversazionale, la cui qualità dipende molto dal contesto.

  4. Tasso di errore sulle parole STT, STT WER. Misura la percentuale letterale di parole trascritte in modo errato. A volte questa precisione conta.

    Negli agenti conversazionali può però essere una metrica di facciata.

    Una trascrizione non deve più essere corretta al 100% per essere efficace al 100%, perché gli LLM moderni sanno leggere tra le righe: trattano “gonna” e “going to” allo stesso modo.

    Una metrica più utile è la WER semantica, che misura quanto la trascrizione comunica l’intento dell’utente invece di penalizzare ogni “um”, “ah” o virgola fuori posto.

    Troppa enfasi sulla WER letterale può aggiungere latenza. La WER semantica si concentra invece su comprensione e risposta all’intento.

  5. Tasso di errore sulle parole TTS, TTS WER. Misura quanto il parlato generato corrisponda al testo sorgente: se il modello articola correttamente le parole, gestisce pronunce complesse e inventa od omette parole.

Costruire IA davvero conversazionale ha molti più livelli che collegare modelli vocali veloci a un LLM. Le conversazioni umane sono disordinate, rumorose e imprevedibili: progettare agenti efficaci richiede equilibrio tra ingegneria e caratteristiche umane, senza perdite significative di qualità, accuratezza o velocità.

In Cartesia crediamo che il potenziale degli agenti inizi da una progettazione attenta e dal controllo preciso dell’esperienza conversazionale completa. Questa filosofia guida progettazione, addestramento, costruzione, valutazione e distribuzione dei nostri SSM. Ogni livello va assemblato intenzionalmente, considerando compromessi, risultati commerciali, obiettivi del caso d’uso e qualità ingegneristica.

Ti aiutiamo a trovare una voce istintiva, affidabile e umana. Scrivi a business@cartesia.ai.