A taxa de erro de palavras, WER, conta diferenças entre uma transcrição e uma referência. Ela pode ajudar a detectar palavras ausentes ou incorretas. Não diz se uma voz é boa para seu produto.
Dois clipes gerados podem dizer exatamente as mesmas palavras e ainda criar experiências muito diferentes. Um soa tranquilizador; o outro parece contente porque seu voo foi cancelado. A transcrição passa. A conversa não.
Nossa abordagem, explicada em Este modelo TTS é bom?, começa pela experiência que queremos proporcionar. Para agentes de voz em tempo real, isso significa entender a resposta na primeira vez, ouvir uma interpretação adequada à situação e conversar sem atrasos ou interrupções desconfortáveis. WER é um diagnóstico dentro dessa avaliação, não uma pontuação a otimizar isoladamente.
O que a taxa de erro de palavras realmente mede
A WER usa o número mínimo de edições de palavras necessário para alinhar uma transcrição à referência:
WER = (substitutions + deletions + insertions) / reference words
Multiplique por 100 para expressá-la como porcentagem. Neste exemplo, a transcrição troca “Tuesday”, terça-feira, por “Thursday”, quinta-feira:
Reference: please move my appointment to next Tuesday morning
Transcript: please move my appointment to next Thursday morning
WER = 1 / 8 = 12.5%
É um erro de uma palavra e uma consulta potencialmente marcada no dia errado. A WER dá a ele o mesmo peso de qualquer outra substituição. A consequência precisa fazer parte da avaliação do produto.
A documentação de WER da Microsoft explica o cálculo; ferramentas como JiWER calculam o alinhamento. Use regras consistentes de normalização de texto e referência. Para a WER de um corpus, divida o total de edições pelo total de palavras de referência em vez de tirar silenciosamente a média das porcentagens de cada clipe. Inserções podem produzir WER acima de 100%, e uma referência vazia exige uma convenção de pontuação documentada porque a fórmula usual divide por zero.
O cálculo é o mesmo em duas configurações distintas de avaliação:
| Avaliação | O que se compara | O que o resultado pode indicar |
|---|---|---|
| Reconhecimento de fala, STT/ASR | A transcrição do reconhecedor com uma referência humana | Com que frequência as palavras reconhecidas divergem da referência |
| Texto em fala, TTS | Uma transcrição ASR do áudio gerado com as palavras pretendidas | Se síntese e reconhecimento, juntos, preservam essas palavras |
Na segunda configuração, você avalia a fala por meio de outro modelo. Um erro aparente de TTS pode vir do reconhecedor. Uma transcrição sem erros também pode esconder fala pouco clara. Você precisa ouvir para saber o que aconteceu.
Por que a WER pode distorcer avaliações de TTS
Palavras idênticas podem soar muito diferentes
O texto não define uma única interpretação correta. “Não acredito” pode expressar entusiasmo, raiva, tristeza ou sarcasmo. Reconhecer todas as palavras não informa se a interpretação combina com a situação.
Os exemplos de áudio em pares no nosso artigo de avaliação tornam isso audível: clipes podem ter a mesma WER e interpretações diferentes. Quando os modelos já dizem de forma confiável as palavras pretendidas em um conjunto de testes, pequenas diferenças de WER podem revelar pouco sobre diferenças de qualidade relevantes aos ouvintes. Mais casas decimais não recuperam informação que a métrica nunca mediu.
O reconhecedor pode inventar e esconder erros
Um modelo ASR pode ter dificuldade com um sotaque, idioma ou nome desconhecido mesmo quando a fala gerada é clara para o público pretendido. Isso aumenta a WER sem comprovar uma falha de síntese.
O contrário também acontece. Um reconhecedor pode inferir uma palavra pouco clara pelo contexto e retornar a transcrição pretendida. Uma pessoa tentando entender um código de conta ao telefone talvez não tenha a mesma sorte.
Mantenha o reconhecedor e a política de pontuação fixos nos testes de regressão e ouça os clipes sinalizados antes de atribuir erros ao TTS. Amostre também clipes aprovados: revisar apenas falhas não revela casos em que o ASR corrigiu a saída. Um reconhecedor fixo torna as comparações mais consistentes; não elimina seus pontos cegos.
A correção depende do contexto
Uma transcrição pode conter “read” tanto quando o modelo pronunciou a palavra no presente quanto no passado em inglês. As palavras coincidem, mas a pronúncia pode estar errada para a frase.
Datas escritas expõem um problema relacionado. “07/08/2026” pode significar 8 de julho em um contexto dos Estados Unidos ou 7 de agosto em um contexto britânico. O produto precisa estabelecer a convenção regional pretendida antes que a referência possa estabelecer o que é correto. Nenhuma interpretação deveria perder só porque quem escreveu a referência presumiu a outra.
Algumas diferenças são inofensivas: “$25” e “vinte e cinco dólares” podem representar a mesma quantia. Outras mudam o significado. Defina formas faladas aceitáveis para a tarefa e diferencie uma divergência de formatação de uma data, quantia ou identificador errado. A normalização de texto não deve apagar um erro relevante para quem liga.
Onde a WER semântica ajuda
A WER semântica busca distinguir diferenças de palavras que preservam o significado de erros que o alteram. “Vinte e cinco dólares” e “$25” podem significar a mesma coisa; “quinze dólares” não. Isso torna uma pontuação sensível ao significado útil junto à WER por palavra, especialmente quando a correspondência literal superestima diferenças inofensivas.
O método de pontuação importa: defina o que conta como equivalente e verifique se o avaliador detecta nomes, quantias e negações alterados. Não presuma que duas implementações de “WER semântica” sejam comparáveis. Mesmo uma correspondência perfeita de significado não diz se a voz soa tranquilizadora, lê um endereço rápido demais ou falha entre blocos de áudio. Ela acrescenta um diagnóstico, não um veredito sobre qualidade conversacional.
Comece pela conversa que você quer viabilizar
Antes de comparar modelos, descreva a situação. Quem escuta? Qual idioma e convenção regional espera? Está ouvindo um endereço por uma conexão telefônica ou uma resposta curta por fones? O que precisa entender ou fazer em seguida?
Para um agente de suporte que lê uma confirmação de consulta, você pode exigir que a pessoa entenda data e horário na primeira escuta, uma interpretação calma e pausas suficientes entre detalhes para acompanhá-los. Uma WER agregada menor não comprova nenhum desses requisitos sozinha.
Construa a avaliação em torno desses requisitos. Para TTS conversacional, usamos dimensões como estas:
| Dimensão | Pergunta a testar | Evidência a coletar |
|---|---|---|
| Correção e clareza | Os ouvintes conseguem recuperar nomes, números, endereços e códigos corretamente? | Transcrições dos ouvintes e verificações dos detalhes críticos, com WER como diagnóstico |
| Correção no contexto | A pronúncia ou expansão falada está correta para a situação? | Revisão com regras explícitas de região, domínio e leituras aceitáveis |
| Interpretação adequada | Ritmo, ênfase e emoção combinam com a conversa? | Comparações de escuta com o cenário informado |
| Capacidade de resposta | A pessoa espera demais ou é interrompida? | Medição de ponta a ponta e observação da alternância de turnos no agente |
| Consistência | O falante permanece estável entre turnos? | Revisão de conversas completas para detectar mudanças de voz, sotaque ou interpretação |
| Comportamento em streaming | A reprodução ao vivo introduz emendas, repetições ou sons cortados? | Áudio capturado pelo caminho de streaming e reprodução pretendido |
Alguns desses testes avaliam o TTS; outros, o agente inteiro. Mantenha essa distinção ao diagnosticar uma falha. Uma interrupção pode vir da detecção de turnos, e uma pausa longa pode vir de uma consulta ao backend, não da geração de fala. A pessoa percebe todos esses problemas, mas a correção depende de onde começam.
Ouça no contexto e teste o caminho ao vivo
A escuta humana é indispensável, mas uma pontuação de preferência também não é uma verdade universal. Diga aos ouvintes o que a voz deve fazer. Recrute pessoas que entendam o idioma e a região e informe onde seus julgamentos divergem, em vez de reduzir todos os públicos a uma média.
Nas comparações de modelos, controle o nível de reprodução, codec, taxa de amostragem e ordem de apresentação. Mantenha sessões curtas o suficiente para limitar a fadiga. Se estiver testando o produto completo, preserve as condições reais de telefonia ou reprodução e declare esse escopo. Caso contrário, você pode confundir um problema de codec com um problema do modelo ou remover um problema de produção ao preparar o teste.
Use clipes curtos e conversas completas. Uma gravação offline bem-acabada não revela todas as falhas de fala gerada enquanto o texto da resposta ainda chega. Ouça emendas abruptas entre blocos, sílabas repetidas e interpretações que começam na direção errada e não conseguem se recuperar. Em conversas mais longas, verifique se a voz ou o sotaque muda.
Separe os resultados por região e tipo de falha. Um modelo pode melhorar a pronúncia de um idioma e piorar o ritmo de outro. Uma pontuação global pode esconder as duas mudanças. Preditores automáticos de qualidade podem ajudar a detectar regressões, mas também precisam de validação nos seus idiomas e condições de áudio; substituir a WER por outro número único não resolve o problema de avaliação.
Use a WER para investigar, não para declarar um vencedor
A WER continua útil para acompanhar regressões por palavra e encontrar clipes que merecem revisão. Para nomes e códigos alfanuméricos, uma fala precisa pode ser essencial. Mantenha essas verificações. Combine-as com evidências de que a fala é compreensível e adequada à conversa em que será usada.
Quando uma pontuação melhora, pergunte o que mudou para o ouvinte. Um endereço ficou mais fácil de entender? Uma palavra ausente voltou? Ou uma mudança de formatação fez referência e transcrição coincidirem? São resultados diferentes, mesmo que o painel use a mesma seta verde.
Para ouvir essas distinções, comece pelos exemplos de áudio em Este modelo TTS é bom?. Depois teste Sonic com seu próprio texto conversacional e configuração de streaming. Escolha o modelo que atende aos requisitos do seu produto nas dimensões relevantes aos usuários. Uma pontuação de transcrição sozinha não pode fazer essa escolha.