Um agente de voz com IA atende o telefone, escuta o que a pessoa quer e faz algo a respeito: agenda a consulta, verifica o pedido, responde à pergunta ou transfere para alguém antes que a pessoa fique sem saída. Chatbots fazem esse trabalho lendo e escrevendo. Um agente de voz faz isso com áudio ao vivo, enquanto a pessoa ainda está no meio da frase.
Essa diferença de tempo concentra a maior parte da engenharia. Esta página explica o que é um agente de voz, como funciona o pipeline, o que dificulta sua construção e as duas formas de criar um na Cartesia.
O que é um agente de voz com IA?
Um agente de voz é um software que mantém uma conversa falada e executa ações. Ele transcreve o que a pessoa diz, decide o que fazer, chama ferramentas como uma agenda ou um sistema de pedidos e fala o resultado. “IA conversacional” é a categoria mais ampla à qual pertence; um agente de voz aplica essa categoria à fala em tempo real. Mantemos uma visão geral de IA conversacional separada para toda a categoria.
Dois sistemas próximos costumam ser confundidos com ele:
| Sistema | O que faz | Por que é diferente |
|---|---|---|
| URA por teclas ou menus | Reproduz menus e encaminha chamadas | Não entende linguagem; a pessoa navega pelo menu, em vez de o sistema se adaptar a ela |
| Chatbot de texto | Lê e escreve texto | Não há áudio ao vivo, e ele pode pausar entre turnos sem que a pessoa perceba |
Um agente de voz pode entender uma solicitação que os menus nunca previram e precisa responder enquanto a pessoa ainda está na linha. Se errar o tempo, as pessoas falam por cima dele, esperam em silêncios desconfortáveis ou desligam.
Como funciona um agente de voz
O ciclo tem quatro etapas, e os bons sistemas as executam simultaneamente, não uma após a outra:
| Etapa | Função | O que observar |
|---|---|---|
| Fala em texto em streaming | Transcrever o áudio à medida que chega | Precisão com seus sotaques, codecs de telefonia e ruído; não descarte o silêncio necessário ao detector de turnos |
| Detecção de turnos | Decidir quando a pessoa concluiu o raciocínio | Uma pausa pode significar “pensando” ou “terminei”; um tempo limite fixo trata os dois da mesma forma |
| LLM e ferramentas | Planejar a resposta e chamar a agenda ou o sistema de pedidos | A latência das ferramentas entra diretamente no tempo de espera |
| Texto em fala | Falar a resposta em streaming enquanto ela é gerada | Começar a falar antes de a frase inteira existir; tratar interrupções corretamente |
A pessoa percebe um único número: o tempo entre terminar a frase e ouvir a resposta. Todas as etapas contribuem. Um modelo de texto em fala com latência inferior a um segundo não salva um agente cujas ferramentas levam três segundos, e um LLM rápido não salva um reconhecedor que deturpa o número da conta. Ao medir, meça o ciclo inteiro. O Ink da Cartesia reúne as duas primeiras etapas em um modelo: transcrição em streaming com detecção nativa de turnos. Sonic é a quarta etapa, um modelo de texto em fala classificado em primeiro lugar em testes cegos de escuta, com latência de modelo inferior a 90ms e mais de 40 idiomas. Você escolhe o modelo de linguagem no meio.
O que torna agentes de voz difíceis
O pipeline é a parte fácil. É em três comportamentos que os agentes falham:
Alternância de turnos. As pessoas não falam em frases completas. Dizem “meu endereço é…” e param para procurá-lo. Estudos de conversação entre idiomas mostram que as pessoas passam a vez umas às outras em cerca de 200 milissegundos (Stivers et al., 2009). Um agente que espera um segundo inteiro para ter certeza já perdeu o ritmo; outro que entra em qualquer pausa interrompe a pessoa. Decidir se uma pausa significa “pensando” ou “terminei” é um problema próprio; escrevemos um guia de detecção de atividade vocal e de turnos sobre isso.
Interrupções. As pessoas mudam de ideia no meio da resposta: “na verdade, coloque na quinta-feira”. Um agente útil para de falar, incorpora a correção e continua. Isso exige cancelar a geração de texto e o áudio já armazenado no buffer do alto-falante da pessoa. É um problema tanto do cliente quanto do servidor.
Recuperação. O reconhecedor vai ouvir errado. A chamada de ferramenta vai exceder o tempo limite. O agente precisa de uma próxima ação: pedir uma confirmação, tentar novamente ou transferir para uma pessoa antes que quem ligou repita tudo pela terceira vez. Agentes que só sabem acertar falham de forma evidente.
Avalie com suas chamadas, não com uma demonstração
Toda demonstração de fornecedor funciona, porque foi escrita para a demonstração. Quem liga para você tem seus sotaques, sua conexão telefônica e sua terminologia. Antes de encaminhar tráfego real, passe um conjunto de chamadas gravadas ou de teste pelo agente e avalie a conversa:
- Ele deixa a pessoa terminar, inclusive complementos como “e, hum, o segundo”?
- Ele começa a responder logo após respostas completas, sem um segundo de silêncio?
- Quando a pessoa interrompe, o áudio realmente para?
- Quando ouve errado, ele confirma ou transfere em vez de adivinhar?
- Quando a ação tem consequências, como cancelar uma reserva ou alterar um pedido, ele confirma antes de executá-la?
O guia de piloto de central de atendimento com IA transforma isso em uma ficha de avaliação para uma fila de suporte. O guia de recepcionista com IA inclui uma tabela de testes de aceitação com um caso de injeção de prompt.
Duas formas de criar um na Cartesia
Managed Agents (/agents) conecta o ciclo para você. Escolha seu LLM, conecte ferramentas e transferências, adicione uma base de conhecimento e obtenha um número de telefone em poucos cliques. A Cartesia executa a infraestrutura de streaming por baixo. É o caminho rápido do zero a um agente que você pode testar.
A API fornece as peças. Sonic para fala, Ink para transcrição em streaming e detecção de turnos, seu próprio LLM no meio, e seu código controla o ciclo. Use quando precisar controlar o modelo, a linguagem de programação ou a implantação. A introdução ao Managed Agents na documentação explica os dois caminhos e o que cada um gerencia para você.
Os dois caminhos usam os mesmos modelos. Eles foram construídos com a arquitetura de modelos de espaço de estados, que viabiliza streaming com essas latências, mas você não precisa se preocupar com isso até se preocupar com a conta.
Onde agentes de voz são usados
Suporte ao cliente e help desks, recepção e agendamento, automação de centrais de atendimento e experiências interativas, como personagens e brinquedos. Decagon, ServiceNow, Quora, Retell e EliseAI criam produtos de voz com a Cartesia; a página de clientes traz os detalhes.