Il word error rate, WER, conta le differenze tra una trascrizione e un riferimento. Aiuta a rilevare parole mancanti o errate. Non può dire se una voce è adatta al tuo prodotto.
Due audio generati possono pronunciare esattamente le stesse parole e creare esperienze molto diverse. Uno rassicura; l’altro sembra felice che il tuo volo sia stato cancellato. La trascrizione supera il test. La conversazione no.
Il nostro approccio, spiegato in Questo modello TTS è valido?, parte dall’esperienza che vogliamo offrire. Per gli agenti in tempo reale significa capire la risposta al primo ascolto, sentire un’interpretazione adatta alla situazione e conversare senza ritardi o interruzioni innaturali. Il WER è un indicatore diagnostico dentro quella valutazione, non un punteggio da ottimizzare da solo.
Cosa misura davvero il word error rate
Il WER usa il numero minimo di modifiche alle parole necessario per allineare una trascrizione al riferimento:
WER = (substitutions + deletions + insertions) / reference words
Moltiplica per 100 per esprimerlo in percentuale. In questo esempio, la trascrizione sostituisce “Tuesday” con “Thursday”:
Reference: please move my appointment to next Tuesday morning
Transcript: please move my appointment to next Thursday morning
WER = 1 / 8 = 12.5%
È un errore di una parola e potenzialmente un appuntamento sbagliato. Il WER gli assegna lo stesso peso di qualsiasi altra sostituzione. La conseguenza va considerata nella valutazione del prodotto.
La documentazione Microsoft sul WER spiega il calcolo; strumenti come JiWER calcolano l’allineamento. Usa regole coerenti di normalizzazione e riferimento. Per il WER di un corpus, dividi le modifiche totali per le parole totali del riferimento anziché fare implicitamente la media delle percentuali degli audio. Gli inserimenti possono produrre WER oltre il 100%; un riferimento vuoto richiede una convenzione documentata perché la formula usuale divide per zero.
Il calcolo è lo stesso in due configurazioni diverse:
| Valutazione | Cosa confronti | Cosa può indicare il risultato |
|---|---|---|
| Riconoscimento vocale, STT/ASR | Trascrizione del riconoscitore contro un riferimento umano | Frequenza con cui le parole riconosciute divergono dal riferimento |
| Sintesi vocale, TTS | Trascrizione ASR dell’audio generato contro le parole previste | Se sintesi e riconoscimento insieme conservano quelle parole |
Nel secondo caso valuti il parlato attraverso un altro modello. Un apparente errore TTS può provenire dal riconoscitore. Una trascrizione pulita può anche nascondere un parlato poco chiaro. Devi ascoltare per capire cosa è successo.
Perché il WER può fuorviare le valutazioni TTS
Parole identiche possono suonare molto diverse
Il testo non specifica un’unica interpretazione corretta. “I can’t believe it” può esprimere entusiasmo, rabbia, tristezza o sarcasmo. Riconoscere tutte le parole non dice se la resa sia adatta alla situazione.
Gli esempi audio abbinati nell’articolo sulla valutazione lo rendono udibile: due audio possono avere lo stesso WER con interpretazioni diverse. Quando i modelli pronunciano affidabilmente le parole previste nel test, piccole differenze di WER possono dire poco sulle qualità che contano agli ascoltatori. Più cifre decimali non recuperano informazioni che la metrica non ha mai misurato.
Il riconoscitore può inventare e nascondere errori
Un ASR può avere difficoltà con un accento, una lingua o un nome sconosciuto anche quando il parlato è chiaro al pubblico previsto. Questo aumenta il WER senza dimostrare un errore di sintesi.
Può accadere anche il contrario. Un riconoscitore può dedurre dal contesto una parola poco chiara e restituire la trascrizione prevista. Una persona che cerca di capire un codice al telefono potrebbe non riuscirci.
Mantieni fissi riconoscitore e regole di punteggio nei test di regressione e ascolta gli audio segnalati prima di attribuire gli errori al TTS. Campiona anche quelli che passano: esaminare solo gli errori non rivela i casi in cui l’ASR ha riparato l’output. Un riconoscitore fisso rende i confronti più coerenti; non elimina i suoi punti ciechi.
La correttezza dipende dal contesto
Una trascrizione può contenere “read” sia che il modello lo pronunci al presente sia al passato. Le parole coincidono, ma la pronuncia può essere sbagliata per quella frase.
Le date scritte mostrano un problema simile. “07/08/2026” può significare 8 luglio negli Stati Uniti o 7 agosto in Gran Bretagna. Il prodotto deve stabilire la variante locale prevista prima che il riferimento possa stabilire la correttezza. Nessuna interpretazione dovrebbe essere penalizzata solo perché chi ha scritto il riferimento ne presumeva un’altra.
Alcune differenze sono innocue: “$25” e “twenty-five dollars” possono indicare lo stesso importo. Altre cambiano il significato. Definisci le forme parlate accettabili per il compito, poi distingui un disallineamento di formato da una data, somma o identificativo sbagliati. La normalizzazione non deve cancellare un errore importante per chi chiama.
Dove aiuta il WER semantico
Il WER semantico cerca di distinguere formulazioni che conservano il significato da errori che lo cambiano. “Twenty-five dollars” e “$25” possono significare lo stesso; “fifteen dollars” no. Un punteggio sensibile al significato è quindi utile accanto al WER sulle parole, soprattutto quando il confronto letterale sovrastima differenze innocue.
Il metodo conta: definisci cosa è equivalente e verifica che il valutatore rilevi nomi, importi e negazioni cambiati. Non presumere che due implementazioni di “WER semantico” siano confrontabili. Anche una corrispondenza perfetta del significato non dice se la voce rassicura, legge un indirizzo troppo in fretta o presenta difetti tra segmenti audio. Aggiunge un indicatore, non un verdetto sulla qualità conversazionale.
Parti dalla conversazione che vuoi supportare
Prima di confrontare i modelli, descrivi la situazione. Chi ascolta? Quale lingua e variante locale si aspetta? Sente un indirizzo al telefono o una risposta breve in cuffia? Cosa deve capire o fare dopo?
Per un agente che legge una conferma di appuntamento, potresti richiedere che chi chiama capisca data e ora al primo ascolto, una resa calma e pause sufficienti tra i dettagli. Un WER aggregato più basso non dimostra da solo nessuno di questi requisiti.
Costruisci la valutazione intorno ai requisiti. Per il TTS conversazionale usiamo dimensioni come queste:
| Dimensione | Domanda da verificare | Evidenze da raccogliere |
|---|---|---|
| Correttezza e chiarezza | Gli ascoltatori ricavano correttamente nomi, numeri, indirizzi e codici? | Trascrizioni degli ascoltatori e verifica dei dettagli critici, con WER come indicatore |
| Correttezza contestuale | Pronuncia o espansione parlata sono giuste per la situazione? | Revisione con regole esplicite su variante locale, dominio e letture accettabili |
| Interpretazione appropriata | Ritmo, enfasi ed emozione si adattano alla conversazione? | Confronti di ascolto con scenario fornito |
| Reattività | Chi chiama aspetta troppo o viene interrotto? | Tempi completi e osservazioni sui turni nell’agente |
| Coerenza | La voce resta stabile tra i turni? | Revisione di conversazioni intere per cambi di voce, accento o interpretazione |
| Comportamento in streaming | La riproduzione dal vivo introduce raccordi, ripetizioni o suoni troncati? | Audio acquisito dal percorso previsto di streaming e riproduzione |
Alcuni test valutano il TTS, altri l’intero agente. Mantieni la distinzione quando analizzi un errore. Un’interruzione può dipendere dal rilevamento dei turni e una pausa lunga da una ricerca backend anziché dalla sintesi. Chi chiama sperimenta tutto, ma la correzione dipende dall’origine del problema.
Ascolta nel contesto e prova il percorso dal vivo
L’ascolto umano è indispensabile, ma neppure un punteggio di preferenza è una verità universale. Spiega agli ascoltatori cosa deve fare la voce. Coinvolgi persone che comprendono lingua e variante locale e riporta dove i giudizi divergono, anziché ridurre ogni pubblico a una media.
Per confrontare modelli, controlla livello di riproduzione, codec, frequenza di campionamento e ordine di presentazione. Mantieni le sessioni abbastanza brevi da limitare la stanchezza. Se provi invece il prodotto completo, conserva le condizioni reali telefoniche o di riproduzione e dichiara quell’ambito. Altrimenti puoi scambiare un problema di codec per uno del modello o eliminare un problema di produzione preparando il test.
Usa audio brevi e conversazioni complete. Una registrazione offline rifinita non rivela ogni difetto del parlato generato mentre il testo della risposta sta ancora arrivando. Ascolta raccordi bruschi, sillabe ripetute e interpretazioni che partono male e non recuperano. Nelle conversazioni lunghe, verifica la deriva di voce o accento.
Separa i risultati per variante locale e tipo di errore. Un modello può migliorare la pronuncia di una lingua e peggiorare il ritmo di un’altra. Un punteggio globale può nascondere entrambi. I predittori automatici aiutano a cercare regressioni, ma vanno validati sulle tue lingue e condizioni audio. Sostituire il WER con un altro numero unico non risolve il problema.
Usa il WER per indagare, non per proclamare un vincitore
Il WER resta utile per seguire regressioni sulle parole e individuare audio da rivedere. Per nomi e codici alfanumerici, una pronuncia accurata può essere essenziale. Mantieni queste verifiche e affiancale a prove che il parlato sia comprensibile e appropriato nella conversazione prevista.
Quando migliora un punteggio, chiedi cosa è cambiato per l’ascoltatore. Un indirizzo è diventato più comprensibile? È tornata una parola mancante? O una modifica di formato ha fatto coincidere riferimento e trascrizione? Sono esiti diversi, anche se la dashboard mostra la stessa freccia verde.
Per sentire le differenze, parti dagli esempi audio di Questo modello TTS è valido?. Poi prova Sonic con i tuoi testi conversazionali e la tua configurazione di streaming. Scegli il modello che soddisfa i requisiti del prodotto nelle dimensioni importanti per gli utenti. Un punteggio di trascrizione da solo non può scegliere.