Design de IA conversacional é decidir o que um agente de IA diz, quando diz e o que acontece quando a conversa dá errado. A maioria dos guias sobre o assunto foi escrita para chatbots. Este é para agentes de voz, em que quem liga não pode voltar, toda pausa é audível e o reconhecimento de fala às vezes vai ouvir “quinze” quando alguém disse “cinquenta”.
Nós fazemos os modelos de voz e a plataforma de agentes em que os agentes de voz rodam, então este guia aponta a configuração da Cartesia que resolve cada problema. As ideias valem para qualquer stack. A versão curta: projete para a tarefa, escreva para o ouvido e dedique a maior parte do esforço aos momentos em que as coisas saem do trilho. Ninguém nunca gostou de ouvir “Desculpe, não entendi” três vezes seguidas.
Voz e chat são problemas de design diferentes
Muitos conselhos de design conversacional servem tanto para chat quanto para voz. Muitos outros, não.
| Chat | Voz | |
|---|---|---|
| Leitura | O usuário pode reler, passar os olhos e voltar | Quem liga ouve cada palavra uma vez, em ordem |
| Tamanho | Um parágrafo com uma lista funciona | Duas frases já são um turno longo |
| Opções | Botões e links | Quem liga precisa lembrar as opções |
| Silêncio | Ninguém nota uma espera de dois segundos | Uma pausa de um segundo parece que a ligação caiu |
| Erros de entrada | O usuário vê os próprios erros de digitação | Erros de reconhecimento ficam invisíveis até o agente repeti-los |
| Interrupções | Raras | Constantes, e o agente precisa parar de falar |
A pesquisa de usabilidade diz isso há tempos. Quando o Nielsen Norman Group testou assistentes de voz em 2018, viu que eles só funcionavam bem para perguntas simples com respostas curtas. Os LLMs deixaram os agentes muito melhores em entender a pergunta. Não mudaram o quanto uma pessoa consegue guardar na cabeça enquanto escuta.
Comece pela tarefa, não pela persona
Antes de escrever uma saudação ou escolher uma voz, anote as duas ou três tarefas que o agente precisa concluir e o que significa “pronto” em cada uma. “Remarcar uma consulta” está pronto quando o novo horário está na agenda e a pessoa ouviu a confirmação. “Responder dúvidas de cobrança” não é uma tarefa. “Explicar uma cobrança da última fatura e oferecer reembolso se for duplicada” é.
Para cada tarefa, liste as informações de que o agente precisa, de onde elas vêm (quem liga, seu CRM, uma ferramenta) e o que o agente não pode fazer. Essa lista vira as instruções do agente e as descrições das ferramentas. A persona pode vir depois. Um agente simpático que não encontra o pedido continua sendo o agente errado.
Escreva para o ouvido
Respostas faladas pedem hábitos diferentes das escritas:
- Uma pergunta por turno. “Qual é sua data de nascimento e o CEP da conta?” recebe meia resposta. Pergunte uma coisa, depois a outra.
- A resposta primeiro. “Seu pedido saiu na terça e chega na sexta” é melhor do que uma frase que começa pelo rastreamento e só chega à data no fim.
- Poucas opções. Uma regra prática é três no máximo; na quarta, a pessoa já esqueceu a primeira. Se houver mais, faça uma pergunta aberta e deixe o modelo de linguagem interpretar a resposta.
- Sem formatação. Markdown, marcadores e emojis são lidos em voz alta ou somem. Diga ao modelo que ele está escrevendo para fala.
Números, códigos e nomes pedem mais cuidado. O Sonic lê sozinho, corretamente, as formas escritas convencionais: preços como $19.99, datas como 04/20/2025, telefones como (415) 555-1212. Para um código de confirmação que precisa ser lido caractere por caractere, coloque-o numa tag <spell>. Se o modelo pronuncia errado o nome de um produto ou lugar, adicione-o uma vez a um dicionário de pronúncia em vez de brigar com ele em cada prompt. Nossas dicas de prompting incluem um prompt de sistema inicial para fala escrita por LLM que cobre essas regras; é um bom primeiro rascunho do seu.
Teste as frases que quem liga realmente ouve. Um agente que soa ótimo lendo uma saudação ainda pode estragar “seu saldo é $1,204.50, com vencimento em 11/03”.
Projete o tempo
Na conversa, as pessoas passam a vez umas às outras em cerca de 200 milissegundos (Stivers et al., 2009). Um agente que espera um segundo inteiro para ter certeza de que a pessoa terminou parece lento. Um que entra em toda pausa interrompe quem ainda está pensando.
Essa decisão cabe à detecção de turnos, não a um temporizador de silêncio fixo. O Ink, nosso modelo de fala para texto, detecta turnos pelo significado do que foi dito, além do áudio. Ele pode emitir um sinal antecipado quando a pessoa provavelmente terminou, para seu agente começar a preparar a resposta, e retirá-lo se a pessoa continuar. Nosso guia de detecção de atividade vocal e de turnos se aprofunda.
Mais duas decisões de tempo são de design, não de engenharia:
- Diga algo antes de uma tarefa lenta. Se uma chamada de ferramenta leva três segundos, três segundos de silêncio parecem defeito. Uma frase curta, “Vou buscar esse pedido”, avisa a pessoa de que o agente a ouviu. No Managed Agents, as ferramentas têm uma configuração
pre_tool_speechpara isso. - Decida o que pode ser interrompido. Quem liga interrompe o tempo todo, e normalmente o agente deve parar e ouvir. Um aviso legal ou a confirmação de um valor de pagamento são a exceção: termine e depois responda à pergunta.
Confirme o que importa, e só isso
Confirmar tudo é cansativo. Não confirmar nada é como um agente marca o dentista na terça errada. Classifique cada informação pelo custo de um erro:
- Custo baixo: o nome da pessoa na saudação, o assunto da ligação. Confirme de forma implícita, usando a informação: “Claro, posso ajudar com seu pedido.”
- Custo alto: datas, valores, endereços, números de conta, qualquer coisa que dispare uma ação irreversível. Repita e espere um sim: “Fica quinta-feira, 8 de outubro, às 14h30. Posso marcar?”
Os erros de reconhecimento se concentram nas mesmas palavras: nomes de produtos, nomes de ruas, códigos de conta. Se você os conhece de antemão, passe-os ao reconhecedor como keyterms para que ele os ouça certo desde o início. Corrigir uma transcrição errada depois é mais difícil do que evitá-la.
Dê a cada falha um próximo passo
A maior parte do trabalho de design está nos caminhos que dão errado. Planeje estes antes do lançamento:
| Situação | O que o agente deve fazer |
|---|---|
| Não entendeu | Reformular a pergunta, de forma mais específica. Não repeti-la palavra por palavra. |
| Não entendeu duas vezes | Oferecer uma pessoa ou outro canal. No terceiro “como?”, as pessoas começam a apertar zero sem parar. |
| Silêncio | Chamar uma vez e depois oferecer retorno ou encerrar com educação. |
| Fora do escopo | Dizer com o que o agente pode ajudar e oferecer uma transferência. |
| Uma ferramenta falhou | Dizer que o sistema está indisponível e dar o próximo passo. Nunca inventar uma resposta. |
| Quem liga pede ao agente que ignore as instruções | Recusar e seguir com a tarefa. Teste isso antes do lançamento. |
Escreva a regra das duas tentativas explicitamente nas instruções do agente. LLMs têm paciência infinita, e paciência infinita numa ligação parece uma armadilha.
Deixe a transferência fácil de alcançar
Todo agente precisa de um jeito de chegar a uma pessoa, e quem liga deve poder pedir isso a qualquer momento. No Managed Agents, a ferramenta de sistema transfer_to_number encaminha a ligação para um número de telefone ou endereço SIP, com uma condição em linguagem natural para cada destino, como “The caller has a billing or payment question”.
Saiba que tipo de transferência você tem. Numa transferência fria, a ligação vai direto para o destino e o agente sai. Numa transferência quente, alguém põe a pessoa que atende a par do caso antes de quem liga entrar. As transferências que a Cartesia documenta hoje são frias; a documentação de SIP trunking as descreve como transferências SIP REFER. Projete para isso: faça o agente dizer à pessoa com quem ela vai falar e por quê e, se quem atende precisar de contexto, escreva um resumo curto no seu CRM com uma ferramenta webhook antes da transferência, para ninguém precisar perguntar “e do que se trata?”.
Teste com ligações reais
Um roteiro lido em voz alta pela equipe que o escreveu sempre passa. Quem liga de verdade não vai ler o roteiro. Antes de direcionar tráfego real:
- Reúna de 20 a 50 gravações ou transcrições reais da fila que você vai automatizar e passe-as pelo agente.
- Inclua as difíceis: ruído de fundo, sotaques, pessoas que mudam de ideia no meio da frase, pessoas que pedem um atendente nos primeiros cinco segundos.
- Avalie resultados, não impressões. O Managed Agents pode avaliar ligações concluídas com métricas personalizadas, que são juízes LLM definidos por você (“O problema de quem ligou foi resolvido?”). Ele também registra o tempo até o primeiro byte de áudio no primeiro turno do agente em cada ligação.
- Ouça você mesmo uma amostra toda semana depois do lançamento. Transcrições escondem o tom, as pausas longas e as falas por cima de quem liga.
O guia para pilotar uma central de atendimento com IA transforma isso numa ficha de avaliação para uma fila. Para criar um agente que você possa testar assim, comece com o Managed Agents e uma conta gratuita no playground da Cartesia.