Design de IA conversacional para agentes de voz

Rene, Kabir Goel 
Design de IA conversacional para agentes de voz

Design de IA conversacional é decidir o que um agente de IA diz, quando diz e o que acontece quando a conversa dá errado. A maioria dos guias sobre o assunto foi escrita para chatbots. Este é para agentes de voz, em que quem liga não pode voltar, toda pausa é audível e o reconhecimento de fala às vezes vai ouvir “quinze” quando alguém disse “cinquenta”.

Nós fazemos os modelos de voz e a plataforma de agentes em que os agentes de voz rodam, então este guia aponta a configuração da Cartesia que resolve cada problema. As ideias valem para qualquer stack. A versão curta: projete para a tarefa, escreva para o ouvido e dedique a maior parte do esforço aos momentos em que as coisas saem do trilho. Ninguém nunca gostou de ouvir “Desculpe, não entendi” três vezes seguidas.

Voz e chat são problemas de design diferentes

Muitos conselhos de design conversacional servem tanto para chat quanto para voz. Muitos outros, não.

ChatVoz
LeituraO usuário pode reler, passar os olhos e voltarQuem liga ouve cada palavra uma vez, em ordem
TamanhoUm parágrafo com uma lista funcionaDuas frases já são um turno longo
OpçõesBotões e linksQuem liga precisa lembrar as opções
SilêncioNinguém nota uma espera de dois segundosUma pausa de um segundo parece que a ligação caiu
Erros de entradaO usuário vê os próprios erros de digitaçãoErros de reconhecimento ficam invisíveis até o agente repeti-los
InterrupçõesRarasConstantes, e o agente precisa parar de falar

A pesquisa de usabilidade diz isso há tempos. Quando o Nielsen Norman Group testou assistentes de voz em 2018, viu que eles só funcionavam bem para perguntas simples com respostas curtas. Os LLMs deixaram os agentes muito melhores em entender a pergunta. Não mudaram o quanto uma pessoa consegue guardar na cabeça enquanto escuta.

Comece pela tarefa, não pela persona

Antes de escrever uma saudação ou escolher uma voz, anote as duas ou três tarefas que o agente precisa concluir e o que significa “pronto” em cada uma. “Remarcar uma consulta” está pronto quando o novo horário está na agenda e a pessoa ouviu a confirmação. “Responder dúvidas de cobrança” não é uma tarefa. “Explicar uma cobrança da última fatura e oferecer reembolso se for duplicada” é.

Para cada tarefa, liste as informações de que o agente precisa, de onde elas vêm (quem liga, seu CRM, uma ferramenta) e o que o agente não pode fazer. Essa lista vira as instruções do agente e as descrições das ferramentas. A persona pode vir depois. Um agente simpático que não encontra o pedido continua sendo o agente errado.

Escreva para o ouvido

Respostas faladas pedem hábitos diferentes das escritas:

  • Uma pergunta por turno. “Qual é sua data de nascimento e o CEP da conta?” recebe meia resposta. Pergunte uma coisa, depois a outra.
  • A resposta primeiro. “Seu pedido saiu na terça e chega na sexta” é melhor do que uma frase que começa pelo rastreamento e só chega à data no fim.
  • Poucas opções. Uma regra prática é três no máximo; na quarta, a pessoa já esqueceu a primeira. Se houver mais, faça uma pergunta aberta e deixe o modelo de linguagem interpretar a resposta.
  • Sem formatação. Markdown, marcadores e emojis são lidos em voz alta ou somem. Diga ao modelo que ele está escrevendo para fala.

Números, códigos e nomes pedem mais cuidado. O Sonic lê sozinho, corretamente, as formas escritas convencionais: preços como $19.99, datas como 04/20/2025, telefones como (415) 555-1212. Para um código de confirmação que precisa ser lido caractere por caractere, coloque-o numa tag <spell>. Se o modelo pronuncia errado o nome de um produto ou lugar, adicione-o uma vez a um dicionário de pronúncia em vez de brigar com ele em cada prompt. Nossas dicas de prompting incluem um prompt de sistema inicial para fala escrita por LLM que cobre essas regras; é um bom primeiro rascunho do seu.

Teste as frases que quem liga realmente ouve. Um agente que soa ótimo lendo uma saudação ainda pode estragar “seu saldo é $1,204.50, com vencimento em 11/03”.

Projete o tempo

Na conversa, as pessoas passam a vez umas às outras em cerca de 200 milissegundos (Stivers et al., 2009). Um agente que espera um segundo inteiro para ter certeza de que a pessoa terminou parece lento. Um que entra em toda pausa interrompe quem ainda está pensando.

Essa decisão cabe à detecção de turnos, não a um temporizador de silêncio fixo. O Ink, nosso modelo de fala para texto, detecta turnos pelo significado do que foi dito, além do áudio. Ele pode emitir um sinal antecipado quando a pessoa provavelmente terminou, para seu agente começar a preparar a resposta, e retirá-lo se a pessoa continuar. Nosso guia de detecção de atividade vocal e de turnos se aprofunda.

Mais duas decisões de tempo são de design, não de engenharia:

  • Diga algo antes de uma tarefa lenta. Se uma chamada de ferramenta leva três segundos, três segundos de silêncio parecem defeito. Uma frase curta, “Vou buscar esse pedido”, avisa a pessoa de que o agente a ouviu. No Managed Agents, as ferramentas têm uma configuração pre_tool_speech para isso.
  • Decida o que pode ser interrompido. Quem liga interrompe o tempo todo, e normalmente o agente deve parar e ouvir. Um aviso legal ou a confirmação de um valor de pagamento são a exceção: termine e depois responda à pergunta.

Confirme o que importa, e só isso

Confirmar tudo é cansativo. Não confirmar nada é como um agente marca o dentista na terça errada. Classifique cada informação pelo custo de um erro:

  • Custo baixo: o nome da pessoa na saudação, o assunto da ligação. Confirme de forma implícita, usando a informação: “Claro, posso ajudar com seu pedido.”
  • Custo alto: datas, valores, endereços, números de conta, qualquer coisa que dispare uma ação irreversível. Repita e espere um sim: “Fica quinta-feira, 8 de outubro, às 14h30. Posso marcar?”

Os erros de reconhecimento se concentram nas mesmas palavras: nomes de produtos, nomes de ruas, códigos de conta. Se você os conhece de antemão, passe-os ao reconhecedor como keyterms para que ele os ouça certo desde o início. Corrigir uma transcrição errada depois é mais difícil do que evitá-la.

Dê a cada falha um próximo passo

A maior parte do trabalho de design está nos caminhos que dão errado. Planeje estes antes do lançamento:

SituaçãoO que o agente deve fazer
Não entendeuReformular a pergunta, de forma mais específica. Não repeti-la palavra por palavra.
Não entendeu duas vezesOferecer uma pessoa ou outro canal. No terceiro “como?”, as pessoas começam a apertar zero sem parar.
SilêncioChamar uma vez e depois oferecer retorno ou encerrar com educação.
Fora do escopoDizer com o que o agente pode ajudar e oferecer uma transferência.
Uma ferramenta falhouDizer que o sistema está indisponível e dar o próximo passo. Nunca inventar uma resposta.
Quem liga pede ao agente que ignore as instruçõesRecusar e seguir com a tarefa. Teste isso antes do lançamento.

Escreva a regra das duas tentativas explicitamente nas instruções do agente. LLMs têm paciência infinita, e paciência infinita numa ligação parece uma armadilha.

Deixe a transferência fácil de alcançar

Todo agente precisa de um jeito de chegar a uma pessoa, e quem liga deve poder pedir isso a qualquer momento. No Managed Agents, a ferramenta de sistema transfer_to_number encaminha a ligação para um número de telefone ou endereço SIP, com uma condição em linguagem natural para cada destino, como “The caller has a billing or payment question”.

Saiba que tipo de transferência você tem. Numa transferência fria, a ligação vai direto para o destino e o agente sai. Numa transferência quente, alguém põe a pessoa que atende a par do caso antes de quem liga entrar. As transferências que a Cartesia documenta hoje são frias; a documentação de SIP trunking as descreve como transferências SIP REFER. Projete para isso: faça o agente dizer à pessoa com quem ela vai falar e por quê e, se quem atende precisar de contexto, escreva um resumo curto no seu CRM com uma ferramenta webhook antes da transferência, para ninguém precisar perguntar “e do que se trata?”.

Teste com ligações reais

Um roteiro lido em voz alta pela equipe que o escreveu sempre passa. Quem liga de verdade não vai ler o roteiro. Antes de direcionar tráfego real:

  • Reúna de 20 a 50 gravações ou transcrições reais da fila que você vai automatizar e passe-as pelo agente.
  • Inclua as difíceis: ruído de fundo, sotaques, pessoas que mudam de ideia no meio da frase, pessoas que pedem um atendente nos primeiros cinco segundos.
  • Avalie resultados, não impressões. O Managed Agents pode avaliar ligações concluídas com métricas personalizadas, que são juízes LLM definidos por você (“O problema de quem ligou foi resolvido?”). Ele também registra o tempo até o primeiro byte de áudio no primeiro turno do agente em cada ligação.
  • Ouça você mesmo uma amostra toda semana depois do lançamento. Transcrições escondem o tom, as pausas longas e as falas por cima de quem liga.

O guia para pilotar uma central de atendimento com IA transforma isso numa ficha de avaliação para uma fila. Para criar um agente que você possa testar assim, comece com o Managed Agents e uma conta gratuita no playground da Cartesia.

Guias relacionados

Perguntas frequentes

O que é design de IA conversacional?

Design de IA conversacional é decidir o que um agente de IA diz, quando diz, o que pergunta e o que acontece quando a conversa dá errado. Inclui as instruções do agente, a forma de falar, como ele confirma informações, como se recupera de mal-entendidos e quando passa a ligação para uma pessoa. Em agentes de voz, inclui também o tempo: quando começar a falar, como lidar com interrupções e como ler números e códigos em voz alta.

Qual a diferença entre projetar um agente de voz e projetar um chatbot?

Quem liga não pode voltar, passar os olhos nem clicar em um botão. Tudo precisa funcionar de primeira, em ordem e em tempo real. Agentes de voz precisam de turnos mais curtos, uma pergunta por vez, confirmação explícita de códigos e números e um plano para erros de reconhecimento de fala e interrupções que um chatbot de texto nunca vê. O silêncio também conta: uma pausa de um segundo numa ligação soa como confusão, enquanto a mesma pausa num chat passa despercebida.

O que faz um designer de conversação?

Um designer de conversação mapeia as tarefas que o agente precisa concluir, escreve as perguntas e respostas, define como o agente confirma dados e se recupera de erros, estabelece as regras para passar a ligação a um humano e testa o resultado com conversas reais. Em agentes baseados em LLM, boa parte do trabalho deixa de ser escrever cada fala e passa a ser escrever instruções, descrições de ferramentas e casos de teste que limitam o que o modelo diz.

Quais são os princípios do design de IA conversacional?

Projete em torno da tarefa que a pessoa veio resolver. Faça turnos curtos e pergunte uma coisa por vez. Confirme só os dados que custam caro se estiverem errados. Dê a cada falha um próximo passo e nunca prenda ninguém num ciclo. Deixe fácil chegar a uma pessoa. Teste com gravações e pessoas reais, não só com um roteiro lido pela equipe que o escreveu.

Quanto tempo um agente de voz deve levar para responder?

Na conversa, as pessoas alternam a fala com intervalos de cerca de 200 milissegundos, então um agente deve começar a responder bem antes de um segundo depois que a pessoa para de falar. Se uma chamada de ferramenta for demorar mais, faça o agente dizer antes uma frase curta ("Vou verificar esse pedido") para a pessoa saber que foi ouvida.