Conceitos de IA de voz que você precisa conhecer
Quando seu agente interrompe o usuário no momento errado, o problema está na fala para texto, ou STT? Na detecção de atividade de voz, ou VAD? Ou o modelo de texto para fala não foi interrompido durante a geração?
São três coisas diferentes, com soluções diferentes. Elas ficam até em partes distintas do pipeline.
Por isso, criar agentes realmente conversacionais é muito mais difícil que apenas escolher um modelo STT ou TTS.
Na Cartesia, construímos IA para que as pessoas possam se expressar e ser compreendidas.
A compreensão começa com um vocabulário comum.
Este artigo apresenta os termos necessários para entender, explorar e raciocinar sobre agentes conversacionais. Ele também ajuda a interpretar os resultados de benchmarks que parecem surgir a cada poucos dias!
Agrupei os termos em seções para facilitar o contexto. E contexto é tudo, especialmente em IA.
Pipeline básico de voz
-
STT, ou fala para texto. É a conversão de fala em texto. Na prática, STT e ASR, reconhecimento automático de fala, costumam ser usados como sinônimos.
Sempre que você dita uma mensagem no celular, está usando STT ou ASR.
Na IA de voz conversacional, uma conversa natural de mão dupla entre humano e IA, esse é o único canal de comunicação da pessoa para o sistema, mas é apenas uma parte dele.
Você pode experimentar gratuitamente os modelos STT da Cartesia, chamados Ink, aqui. Teste seus limites com números de telefone, datas e endereços de e-mail soletrados!
-
VAD, ou detecção de atividade de voz. Modelos VAD são classificadores especializados, diferentes do modelo STT de transcrição. Eles distinguem:
-
silêncio de som no sinal de entrada;
-
fala de sons de fundo.
Eles filtram o sinal de áudio para isolar a fala e enviá-la ao modelo ASR para transcrição.
O Ink-2 STT da Cartesia detecta turnos internamente. Isso simplifica o pipeline, porque você não precisa avaliar, integrar e manter um VAD separado apenas para identificar quando o usuário está falando.
-
-
Detecção de turnos. Também é chamada de endpointing, termo que pode ser confundido com endpoints de API. Aqui, usaremos detecção de turnos.
É a capacidade de identificar corretamente se a pessoa começou, terminou ou retomou seu turno. Isso é mais difícil do que parece. Nem sempre é fácil saber se alguém está fazendo uma pausa, pensando, momentaneamente distraído ou respirando fundo!
A detecção de turnos é essencial para a experiência do agente. Um modelo que conclui cedo demais que a pessoa terminou causa interrupções irritantes. Uma detecção lenta ou imprecisa acrescenta milissegundos valiosos à latência e cria uma conversa artificial, cheia de intervalos desconfortáveis.
Um VAD pouco confiável, combinado com detecção prematura de fim de turno, faz o usuário sentir que está falando com uma IA que não o deixa terminar!
Uma detecção ruim destrói o fluxo natural e pode causar erros de transcrição que se acumulam e prejudicam as ações posteriores do pipeline.
Historicamente, modelos VAD e sistemas de detecção de turnos usam sinais indiretos, como a duração das pausas, para decidir se o turno terminou. Modelos recentes, como o Ink-2 da Cartesia, já integram essa detecção.
-
TTS, ou texto para fala. É o inverso de STT, a conversão de texto em fala sintética. TTS costuma envolver aspectos muito mais subjetivos, como veremos adiante.
A tecnologia existe há décadas. Antes soava robótica, mas bons modelos atuais soam muito naturais. Experimente gratuitamente nossos modelos TTS Sonic aqui!
Recursos de IA de voz conversacional
-
Barge-in, ou tratamento de interrupções. É um recurso extremamente importante em IA de voz conversacional.
Uma IA conversacional empresarial exige muito mais que conectar STT e TTS a um chatbot. Os agentes precisam lidar com conversas humanas desorganizadas, imprevisíveis e sujeitas a variações de ambiente, região e qualidade.
Barge-in permite que o usuário interrompa a IA e faça com que ela pare de falar. Para isso, o modelo TTS precisa saber que o usuário começou ou retomou a fala. Esse evento deve ser detectado antes no pipeline pelo STT ou VAD.
O tratamento de interrupções vai além da detecção de turnos. Exige um projeto cuidadoso dos modelos e da estrutura de orquestração do agente.
A detecção de turnos do STT emite um evento indicando que o usuário começou ou retomou a fala, e a camada de orquestração deve silenciar imediatamente o fluxo TTS. Não é trivial, mas modelos e orquestração bem projetados tornam isso possível.
Na Cartesia, usamos uma arquitetura orientada a eventos para orquestrar agentes de voz. Assim, o sistema pode observar cada evento e reagir adequadamente.
-
Isolamento de voz e redução de ruído. Alguns modelos reduzem o ruído ambiente ou isolam a conversa ativa das conversas ao fundo. Isso importa em escritórios, cafés, aeroportos, centrais de atendimento, hospitais e outros locais movimentados. É um problema difícil, e os modelos diferem na capacidade de resolvê-lo. Demos atenção específica a esse aspecto no Ink-2 ASR, porque agentes empresariais costumam operar em ambientes com ruído, longe de um estúdio.
Características da voz
As características da voz importam, mas podem ser muito subjetivas. Se você e seu melhor amigo discordam sobre a voz de um ator, essa subjetividade explica a diferença.
Ouça exemplos de vozes boas e menos adequadas, considerando o tom, a expressão emocional e outros aspectos.
Boa prosódia
Prosódia monótona
Expressão emocional natural
Expressão emocional exagerada
É mais fácil perceber características indesejáveis que desejáveis. Ao prestar atenção nesses atributos, notamos quando aparecem em excesso ou em quantidade insuficiente. Isso ajuda a decidir se a voz é adequada à finalidade.
-
Prosódia. Reúne altura e entonação, volume e duração, temporização e ritmo. É o “como” da fala, um conjunto de atributos e características técnicas usados para analisar uma voz.
Volume e duração são intuitivos, mas vale esclarecer a entonação.
Ela descreve como a voz sobe e desce durante a fala. Muitas vezes, é o que diferencia pergunta e afirmação, continuidade e encerramento, ênfase e neutralidade. Uma elevação no fim da frase, por exemplo, geralmente sinaliza uma pergunta.
A prosódia acrescenta significado e impacto às palavras. Imagine como “Johnny mordeu o cachorro?” e “Johnny mordeu o cachorro!” provocariam reações diferentes em uma apuração na escola.
-
Expressão emocional. Ela se relaciona à prosódia porque é seu efeito. A prosódia transmite emoção e significado, e humanos são muito sensíveis a detectar e classificar emoções na voz. Em IA de voz, a emoção precisa ser coerente com o caso de uso.
-
Timbre. É a qualidade tonal do som. Na voz, costuma aparecer nos adjetivos usados para descrevê-la. Apresentadores de rádio podem ter vozes calorosas e ricas ou escuras e aveludadas. Alguns cantores soam nasais, outros roucos. O timbre pode dar identidade, ressonância emocional, seriedade e confiança à voz.
-
Velocidade e ritmo. Não se trata apenas de quantas palavras por minuto Eminem consegue cantar. A velocidade tem outro aspecto essencial, o ritmo, que envolve a cadência geral e a posição e duração das pausas. Um bom ritmo facilita acompanhar o áudio, com pausas que se alinham naturalmente à pontuação.
-
Vocal fry, ou voz crepitante. Essa vibração grave e crepitante ocorre quando o ar pulsa lentamente pelas pregas vocais. Ela ajuda no realismo, porque humanos a produzem naturalmente no fim das frases.
Mas cria um equilíbrio delicado para a IA. Modelos ASR podem interpretá-la como ruído de fundo ou silêncio. No treinamento de TTS, o excesso funciona como ruído e pode gerar falhas na fala.
O objetivo é um equilíbrio natural, suficiente para evitar uma voz robótica, sem distorcer a fala nem prejudicar a inteligibilidade.
-
Localização, dialetos e pronúncia. Um bom TTS precisa soar local para transmitir confiança. Isso vai além de um sotaque geral e depende da normalização, a capacidade de interpretar abreviações, datas e moedas conforme a região. Por exemplo, saber se “12/01” é 12 de janeiro ou 1º de dezembro, ou se “Sr.” significa “Senior” ou “Señor”.
A normalização é a camada semântica. Há também a camada fonética, com sotaque, pronúncia e clareza. Um modelo pode normalizar corretamente e ainda soar errado para alguém em Mumbai ou Dublin. Erros em nomes próprios, marcas ou termos técnicos quebram a identidade da marca e podem prejudicar a confiança do ouvinte.
Um agente de qualidade precisa acertar o que diz e como soa para o público específico. Por exemplo:
-
Backchanneling, ou sinais de acompanhamento. São pequenas expressões usadas para mostrar que acompanhamos a conversa, como “hum-hum”, “certo”, “entendi” e “sim”.
Elas não são turnos completos, apenas confirmações e sinais breves.
Na IA conversacional, isso funciona nas duas direções. O TTS precisa produzir esses sinais no momento certo para não parecer robótico e distante. O ASR precisa reconhecê-los como acompanhamento, não como interrupção.
Um agente que interpreta “hum-hum” como interrupção ou nunca sinaliza que está ouvindo parece defeituoso, mesmo que o sistema esteja funcionando corretamente.
Métricas de desempenho
-
Fidelidade à transcrição. Mede a fidelidade da fala TTS ao texto de entrada. Mesmo modelos avançados podem alucinar, adicionando palavras inexistentes, ou omitir frases inteiras. A avaliação também verifica se o modelo articula mal a fala ou produz pronúncias estranhas que se afastam do roteiro.
Sem alta fidelidade, um modelo não serve para leituras jurídicas ou médicas em que a precisão semântica é essencial.
-
Tratamento de dados alfanuméricos. Mede a confiabilidade ao falar dados fora do dicionário, como números de telefone, códigos de rastreamento, datas e endereços de e-mail.
Isso depende da normalização. Primeiro, o modelo precisa interpretar corretamente o formato, como saber se “12/01” está em MM-DD ou DD-MM. Depois, deve falá-lo corretamente. Ler um telefone como um número inteiro grande, em vez de dígito por dígito, causa estranheza, principalmente em saúde, finanças ou logística.
-
RTF, ou fator de tempo real. Em STT, mede a velocidade com que o modelo gera texto a partir de uma duração de áudio. Divide o tempo de processamento pela duração do áudio de entrada.
Se a IA leva 30 segundos para transcrever uma gravação de 1 minuto, ou 60 segundos, o RTF é 0.5, mais rápido que o tempo real. RTF = 1 significa que o processamento dura o mesmo que o áudio. Acima de 1, o STT fica atrasado, pois é mais lento que o tempo real.
Em TTS, o fator é um pouco diferente. Mede o tempo necessário para gerar áudio a partir de texto.
| STT/ASR | TTS |
|---|---|
| A entrada é áudio. A saída é texto. | A entrada é texto. A saída é áudio. |
| RTF = tempo de transcrição / duração do áudio de entrada | RTF = tempo de síntese / duração da fala gerada |
-
TTFS, ou tempo até o segmento final. Para um agente funcionar em uma conversa ao vivo, medir apenas o RTF do ASR não oferece detalhe suficiente.
O que realmente importa é o TTFS, também chamado de TTCT, tempo até a transcrição completa. Ele mede o intervalo entre o usuário terminar seu turno e o STT entregar uma transcrição finalizada, completa e confirmada, pronta para o LLM agir.
Isso é diferente de outro uso da sigla TTFS, o tempo até o primeiro segmento, que mede apenas a chegada do primeiro trecho. O TTCT mede quando toda a transcrição está pronta. Para um agente conversacional, o segmento final é o ponto relevante de passagem para a próxima etapa, porque o restante depende da conclusão do TTCT.
-
TTFB, ou tempo até o primeiro byte. Mede a capacidade de reação do TTS. É o intervalo entre a chegada do texto ao modelo e o início do envio dos primeiros bytes de áudio.
Um TTFB abaixo de 300ms costumava ser a referência para uma conversa natural. Acima disso, surge o atraso incômodo de um rádio comunicador.
Na Cartesia, fomos além. Os modelos Sonic 3 alcançam de 40ms a 90ms, mais rápido que uma piscada humana, de cerca de 100ms.
Isso torna o tempo real de fato real.
-
MOS, ou pontuação média de opinião. Ela existe porque a percepção humana de qualidade, naturalidade, confiança e adequação da voz tem um forte componente subjetivo. Uma voz bem avaliada para meditação pode parecer errada em uma triagem médica. Tradicionalmente, painéis humanos fazem essa avaliação, mas fluxos modernos também usam modelos de IA para prever as pontuações.
MOS é a média das notas de 1 a 5 dadas por ouvintes humanos. É uma forma estruturada de medir a subjetividade e avaliar a voz conforme as expectativas e preferências do público.
Esse método permite avaliar o modelo no contexto e no caso de uso exatos do público-alvo. Isso torna o MOS especialmente relevante para IA conversacional, em que a qualidade depende muito do contexto.
-
Taxa de erro de palavras de STT, ou STT WER. Mede a porcentagem literal de palavras transcritas incorretamente. Às vezes, essa precisão literal importa.
Em agentes conversacionais, porém, o STT WER pode ser uma métrica de vaidade.
Uma transcrição não precisa mais ser 100% exata para ser 100% eficaz, porque LLMs modernos leem muito bem nas entrelinhas. Eles tratam “gonna” e “going to” da mesma forma.
Uma métrica mais útil é o WER semântico, que mede quanto a transcrição preserva a intenção do usuário, em vez de avaliar cada hesitação ou vírgula fora do lugar.
Ênfase excessiva no WER literal também pode adicionar latência. O WER semântico concentra a avaliação em saber se a IA compreende e atende à intenção da pessoa.
-
Taxa de erro de palavras de TTS, ou TTS WER. Em TTS, mede a qualidade da fala gerada em relação à transcrição de origem. Inclui verificar se o modelo articulou corretamente o texto, lidou bem com pronúncias complexas e inventou ou omitiu palavras.
Criar IA realmente conversacional envolve muito mais que conectar modelos de voz rápidos a um LLM. A conversa humana é desorganizada, ruidosa e imprevisível. Projetar agentes eficazes exige equilibrar engenharia e características humanas sem perder qualidade, exatidão ou velocidade de forma relevante.
Na Cartesia, acreditamos que o potencial dos agentes começa no projeto cuidadoso e no controle preciso da experiência completa de conversa. Essa filosofia orienta como nossos modelos de espaço de estados são projetados, treinados, construídos, avaliados e implantados. Cada camada precisa ser combinada de propósito, considerando compromissos, resultados comerciais, objetivos do caso de uso e qualidade de engenharia.
Estamos aqui para ajudar você a encontrar uma voz intuitiva, confiável e humana. Entre em contato em business@cartesia.ai.
