Aprenda

Taxa de erro de palavras: o que a WER não capta na IA de voz

Rene, Kabir Goel 
Taxa de erro de palavras: o que a WER não capta na IA de voz

A taxa de erro de palavras, WER, conta diferenças entre uma transcrição e uma referência. Ela pode ajudar a detectar palavras ausentes ou incorretas. Não diz se uma voz é boa para seu produto.

Dois clipes gerados podem dizer exatamente as mesmas palavras e ainda criar experiências muito diferentes. Um soa tranquilizador; o outro parece contente porque seu voo foi cancelado. A transcrição passa. A conversa não.

Nossa abordagem, explicada em Este modelo TTS é bom?, começa pela experiência que queremos proporcionar. Para agentes de voz em tempo real, isso significa entender a resposta na primeira vez, ouvir uma interpretação adequada à situação e conversar sem atrasos ou interrupções desconfortáveis. WER é um diagnóstico dentro dessa avaliação, não uma pontuação a otimizar isoladamente.

O que a taxa de erro de palavras realmente mede

A WER usa o número mínimo de edições de palavras necessário para alinhar uma transcrição à referência:

WER = (substitutions + deletions + insertions) / reference words

Multiplique por 100 para expressá-la como porcentagem. Neste exemplo, a transcrição troca “Tuesday”, terça-feira, por “Thursday”, quinta-feira:

Reference:  please move my appointment to next Tuesday morning
Transcript: please move my appointment to next Thursday morning

WER = 1 / 8 = 12.5%

É um erro de uma palavra e uma consulta potencialmente marcada no dia errado. A WER dá a ele o mesmo peso de qualquer outra substituição. A consequência precisa fazer parte da avaliação do produto.

A documentação de WER da Microsoft explica o cálculo; ferramentas como JiWER calculam o alinhamento. Use regras consistentes de normalização de texto e referência. Para a WER de um corpus, divida o total de edições pelo total de palavras de referência em vez de tirar silenciosamente a média das porcentagens de cada clipe. Inserções podem produzir WER acima de 100%, e uma referência vazia exige uma convenção de pontuação documentada porque a fórmula usual divide por zero.

O cálculo é o mesmo em duas configurações distintas de avaliação:

AvaliaçãoO que se comparaO que o resultado pode indicar
Reconhecimento de fala, STT/ASRA transcrição do reconhecedor com uma referência humanaCom que frequência as palavras reconhecidas divergem da referência
Texto em fala, TTSUma transcrição ASR do áudio gerado com as palavras pretendidasSe síntese e reconhecimento, juntos, preservam essas palavras

Na segunda configuração, você avalia a fala por meio de outro modelo. Um erro aparente de TTS pode vir do reconhecedor. Uma transcrição sem erros também pode esconder fala pouco clara. Você precisa ouvir para saber o que aconteceu.

Por que a WER pode distorcer avaliações de TTS

Palavras idênticas podem soar muito diferentes

O texto não define uma única interpretação correta. “Não acredito” pode expressar entusiasmo, raiva, tristeza ou sarcasmo. Reconhecer todas as palavras não informa se a interpretação combina com a situação.

Os exemplos de áudio em pares no nosso artigo de avaliação tornam isso audível: clipes podem ter a mesma WER e interpretações diferentes. Quando os modelos já dizem de forma confiável as palavras pretendidas em um conjunto de testes, pequenas diferenças de WER podem revelar pouco sobre diferenças de qualidade relevantes aos ouvintes. Mais casas decimais não recuperam informação que a métrica nunca mediu.

O reconhecedor pode inventar e esconder erros

Um modelo ASR pode ter dificuldade com um sotaque, idioma ou nome desconhecido mesmo quando a fala gerada é clara para o público pretendido. Isso aumenta a WER sem comprovar uma falha de síntese.

O contrário também acontece. Um reconhecedor pode inferir uma palavra pouco clara pelo contexto e retornar a transcrição pretendida. Uma pessoa tentando entender um código de conta ao telefone talvez não tenha a mesma sorte.

Mantenha o reconhecedor e a política de pontuação fixos nos testes de regressão e ouça os clipes sinalizados antes de atribuir erros ao TTS. Amostre também clipes aprovados: revisar apenas falhas não revela casos em que o ASR corrigiu a saída. Um reconhecedor fixo torna as comparações mais consistentes; não elimina seus pontos cegos.

A correção depende do contexto

Uma transcrição pode conter “read” tanto quando o modelo pronunciou a palavra no presente quanto no passado em inglês. As palavras coincidem, mas a pronúncia pode estar errada para a frase.

Datas escritas expõem um problema relacionado. “07/08/2026” pode significar 8 de julho em um contexto dos Estados Unidos ou 7 de agosto em um contexto britânico. O produto precisa estabelecer a convenção regional pretendida antes que a referência possa estabelecer o que é correto. Nenhuma interpretação deveria perder só porque quem escreveu a referência presumiu a outra.

Algumas diferenças são inofensivas: “$25” e “vinte e cinco dólares” podem representar a mesma quantia. Outras mudam o significado. Defina formas faladas aceitáveis para a tarefa e diferencie uma divergência de formatação de uma data, quantia ou identificador errado. A normalização de texto não deve apagar um erro relevante para quem liga.

Onde a WER semântica ajuda

A WER semântica busca distinguir diferenças de palavras que preservam o significado de erros que o alteram. “Vinte e cinco dólares” e “$25” podem significar a mesma coisa; “quinze dólares” não. Isso torna uma pontuação sensível ao significado útil junto à WER por palavra, especialmente quando a correspondência literal superestima diferenças inofensivas.

O método de pontuação importa: defina o que conta como equivalente e verifique se o avaliador detecta nomes, quantias e negações alterados. Não presuma que duas implementações de “WER semântica” sejam comparáveis. Mesmo uma correspondência perfeita de significado não diz se a voz soa tranquilizadora, lê um endereço rápido demais ou falha entre blocos de áudio. Ela acrescenta um diagnóstico, não um veredito sobre qualidade conversacional.

Comece pela conversa que você quer viabilizar

Antes de comparar modelos, descreva a situação. Quem escuta? Qual idioma e convenção regional espera? Está ouvindo um endereço por uma conexão telefônica ou uma resposta curta por fones? O que precisa entender ou fazer em seguida?

Para um agente de suporte que lê uma confirmação de consulta, você pode exigir que a pessoa entenda data e horário na primeira escuta, uma interpretação calma e pausas suficientes entre detalhes para acompanhá-los. Uma WER agregada menor não comprova nenhum desses requisitos sozinha.

Construa a avaliação em torno desses requisitos. Para TTS conversacional, usamos dimensões como estas:

DimensãoPergunta a testarEvidência a coletar
Correção e clarezaOs ouvintes conseguem recuperar nomes, números, endereços e códigos corretamente?Transcrições dos ouvintes e verificações dos detalhes críticos, com WER como diagnóstico
Correção no contextoA pronúncia ou expansão falada está correta para a situação?Revisão com regras explícitas de região, domínio e leituras aceitáveis
Interpretação adequadaRitmo, ênfase e emoção combinam com a conversa?Comparações de escuta com o cenário informado
Capacidade de respostaA pessoa espera demais ou é interrompida?Medição de ponta a ponta e observação da alternância de turnos no agente
ConsistênciaO falante permanece estável entre turnos?Revisão de conversas completas para detectar mudanças de voz, sotaque ou interpretação
Comportamento em streamingA reprodução ao vivo introduz emendas, repetições ou sons cortados?Áudio capturado pelo caminho de streaming e reprodução pretendido

Alguns desses testes avaliam o TTS; outros, o agente inteiro. Mantenha essa distinção ao diagnosticar uma falha. Uma interrupção pode vir da detecção de turnos, e uma pausa longa pode vir de uma consulta ao backend, não da geração de fala. A pessoa percebe todos esses problemas, mas a correção depende de onde começam.

Ouça no contexto e teste o caminho ao vivo

A escuta humana é indispensável, mas uma pontuação de preferência também não é uma verdade universal. Diga aos ouvintes o que a voz deve fazer. Recrute pessoas que entendam o idioma e a região e informe onde seus julgamentos divergem, em vez de reduzir todos os públicos a uma média.

Nas comparações de modelos, controle o nível de reprodução, codec, taxa de amostragem e ordem de apresentação. Mantenha sessões curtas o suficiente para limitar a fadiga. Se estiver testando o produto completo, preserve as condições reais de telefonia ou reprodução e declare esse escopo. Caso contrário, você pode confundir um problema de codec com um problema do modelo ou remover um problema de produção ao preparar o teste.

Use clipes curtos e conversas completas. Uma gravação offline bem-acabada não revela todas as falhas de fala gerada enquanto o texto da resposta ainda chega. Ouça emendas abruptas entre blocos, sílabas repetidas e interpretações que começam na direção errada e não conseguem se recuperar. Em conversas mais longas, verifique se a voz ou o sotaque muda.

Separe os resultados por região e tipo de falha. Um modelo pode melhorar a pronúncia de um idioma e piorar o ritmo de outro. Uma pontuação global pode esconder as duas mudanças. Preditores automáticos de qualidade podem ajudar a detectar regressões, mas também precisam de validação nos seus idiomas e condições de áudio; substituir a WER por outro número único não resolve o problema de avaliação.

Use a WER para investigar, não para declarar um vencedor

A WER continua útil para acompanhar regressões por palavra e encontrar clipes que merecem revisão. Para nomes e códigos alfanuméricos, uma fala precisa pode ser essencial. Mantenha essas verificações. Combine-as com evidências de que a fala é compreensível e adequada à conversa em que será usada.

Quando uma pontuação melhora, pergunte o que mudou para o ouvinte. Um endereço ficou mais fácil de entender? Uma palavra ausente voltou? Ou uma mudança de formatação fez referência e transcrição coincidirem? São resultados diferentes, mesmo que o painel use a mesma seta verde.

Para ouvir essas distinções, comece pelos exemplos de áudio em Este modelo TTS é bom?. Depois teste Sonic com seu próprio texto conversacional e configuração de streaming. Escolha o modelo que atende aos requisitos do seu produto nas dimensões relevantes aos usuários. Uma pontuação de transcrição sozinha não pode fazer essa escolha.

Perguntas frequentes

O que é taxa de erro de palavras?

A taxa de erro de palavras mede as substituições, exclusões e inserções necessárias para alinhar uma transcrição a uma referência, divididas pelo número de palavras da referência. No reconhecimento de fala, compara a saída do modelo com uma transcrição humana. Na avaliação de TTS, geralmente compara uma transcrição ASR da fala gerada com as palavras pretendidas. Ela não mede a qualidade geral da voz.

Uma WER menor significa um modelo TTS melhor?

Não necessariamente. WER menor significa menos edições de palavras em uma configuração específica de avaliação. Falas com a mesma WER podem diferir em ritmo, expressão, pronúncia no contexto e consistência do falante. O modelo ASR usado para transcrever a fala gerada também pode introduzir erros ou inferir palavras que um ouvinte humano teria dificuldade de entender.

Qual é uma boa taxa de erro de palavras?

Não há um limite universal que estabeleça que um produto está pronto. A WER depende do conjunto de dados, idioma, referência e política de normalização. Para TTS conversacional, avalie correção no contexto, clareza, interpretação, latência e comportamento em streaming junto à WER, com ouvintes que entendam o idioma e a situação pretendidos.

Como calcular a WER?

Use um alinhamento de edição mínima para contar substituições, exclusões e inserções. Some essas contagens, divida pelo número de palavras da referência e multiplique por 100 para obter uma porcentagem. Uma substituição em uma referência de oito palavras resulta em WER de 12.5%. Inserções podem levar a WER acima de 100%; a fórmula usual é indefinida para uma referência vazia.