Alucinações de ASR podem inserir na transcrição palavras que a pessoa nunca disse. Um novo artigo, Grounded in Sound, testa se feedback acústico no treinamento reduz esses erros. Os resultados com áudio de reuniões mostram por que medir inserções separadamente do WER geral.
O que mudou nos resultados de alucinação de ASR?
Os autores relatam reduções relativas de inserções de 28.3% na fala de reuniões AMI-IHM, gravada com microfone próximo, e 22.3% no AMI-SDM, com microfone distante. No AMI-SDM, o WER caiu de 35.89% para 34.71%. As outras cinco condições de avaliação não apresentaram diferença estatisticamente detectável de WER em relação à referência treinada apenas com WER e com o mesmo cronograma.
São medidas diferentes. Reduzir inserções em 22.3% não significa reduzir todos os erros de transcrição em 22.3%. A melhora de WER no áudio distante foi de 1.18 ponto percentual. Uma avaliação que registre apenas WER total deixaria de mostrar boa parte da mudança na composição dos erros.
O escopo é específico. Os experimentos usam uma política Qwen2-Audio-7B adaptada com LoRA e um avaliador wav2vec2-CTC congelado de 0.3B. Os autores demonstram o mecanismo em uma configuração. Os resultados não comprovam ganhos equivalentes em outros modelos, idiomas ou condições de chamadas em produção.
Como funciona o avaliador acústico?
Durante o treinamento, a política amostra grupos de oito transcrições candidatas. Um modelo CTC pré-treinado separadamente e congelado as pontua em relação ao áudio. A recompensa combina essa pontuação acústica com um termo baseado no WER. As saídas por quadro do avaliador são reutilizadas entre as candidatas de cada enunciado.
A seção de método coloca o avaliador adicional no treinamento. Na inferência, a política executa uma única decodificação gulosa sem esse avaliador externo. O artigo não apresenta uma comparação de latência de ponta a ponta com modelos de produção.
A recompensa também tem limites. Sua normalização depende do comprimento das candidatas, e o avaliador fica menos confiável quando o áudio sofre degradação severa. O artigo relata mais exclusões junto com menos inserções. Em uma aplicação, ambos os erros importam. Omitir um item solicitado e inventar outro podem ter consequências diferentes.
Reavaliar hipóteses na inferência reproduz o resultado?
Os autores testaram uma configuração CTC que reavalia as 32 melhores hipóteses na política de referência. Ela não recuperou os ganhos nas inserções da política treinada com feedback acústico. Isso é evidência sobre a configuração testada, não uma rejeição de todos os métodos possíveis.
Os autores atualizam os pesos por pós-treinamento com aprendizado por reforço. O artigo não avalia mudanças de configuração em APIs de transcrição hospedadas. Os experimentos de confiança sem avaliador oferecem outra direção de pesquisa. Para produção, recomendamos testar a abstenção baseada em confiança em áudio representativo e relatar o efeito na cobertura.
O que uma equipe de agentes deve medir?
Uma avaliação prática deve preservar áudio e transcrição de referência e relatar inserções, exclusões e substituições junto com o WER. Agrupe os resultados por condição de gravação. Inclua sobreposição de fala, ruído de fundo e distância do microfone que a aplicação realmente encontra.
Também revisaríamos exemplos em que a transcrição muda uma ação. Uma quantidade inventada, uma negação omitida ou um nome alterado podem importar mais ao fluxo que várias diferenças inofensivas de palavras. Essa é uma recomendação de avaliação, não um resultado medido pelo artigo.
O tempo dos turnos é uma questão separada nessa avaliação. O Ink 2 expõe eventos como turn.start, turn.eager_end e turn.end. Eles permitem coordenar escuta e resposta, mas não comprovam que a transcrição está factualmente correta. O artigo não avalia Ink 2 nem mostra que configurações de fim de turno reproduzam os resultados da recompensa acústica.
Quais são os limites da evidência?
Leia a configuração de avaliação e as limitações antes de adotar o método. O treinamento usa LibriSpeech com aumento de dados por ruído aditivo e avalia seis condições, incluindo reuniões AMI. As 33,282 instâncias de enunciado e condição não são todas gravações independentes. Os enunciados LibriSpeech reaparecem com ruídos diferentes, e as duas condições AMI vêm das mesmas reuniões.
O AMI ficou fora do treinamento por reforço, mas informou uma decisão diagnóstica sobre quais condições acústicas incluir no treinamento. Dizer que não teve papel algum antes da avaliação final exageraria a separação.
O resultado útil é a redução de inserções em uma configuração definida de treinamento e avaliação. Para equipes que avaliam reconhecimento de fala, a lição imediata é inspecionar quais erros mudaram. Um WER agregado menor, sozinho, não revela se o modelo passou a inventar menos palavras.