Diseño de IA conversacional para agentes de voz

Rene, Kabir Goel 
Diseño de IA conversacional para agentes de voz

El diseño de IA conversacional consiste en decidir qué dice un agente de IA, cuándo lo dice y qué pasa cuando la conversación sale mal. La mayoría de las guías están escritas para chatbots. Esta es para agentes de voz, donde quien llama no puede volver atrás, cada pausa se oye y el reconocedor de voz a veces oirá «quince» cuando alguien dijo «cincuenta».

Hacemos los modelos de voz y la plataforma de agentes sobre la que funcionan los agentes de voz, así que esta guía señala el ajuste de Cartesia que resuelve cada problema. Las ideas valen para cualquier stack. La versión corta: diseña para la tarea, escribe para el oído y dedica la mayor parte del esfuerzo a los momentos en que las cosas se tuercen. A nadie le ha gustado nunca oír «Perdona, no te he entendido» tres veces seguidas.

Voz y chat son problemas de diseño distintos

Muchos consejos de diseño conversacional sirven tanto para chat como para voz. Muchos otros no.

ChatVoz
LecturaEl usuario puede releer, leer en diagonal y volver atrásQuien llama oye cada palabra una vez, en orden
LongitudUn párrafo con una lista está bienDos frases ya es un turno largo
OpcionesBotones y enlacesQuien llama tiene que recordar las opciones
SilencioNadie nota una espera de dos segundosUna pausa de un segundo suena a que se ha cortado la línea
Errores de entradaEl usuario ve sus erratasLos errores de reconocimiento son invisibles hasta que el agente los repite
InterrupcionesRarasConstantes, y el agente tiene que dejar de hablar

La investigación en usabilidad lo dice desde hace tiempo. Cuando Nielsen Norman Group probó asistentes de voz en 2018, vio que solo funcionaban bien con preguntas sencillas de respuesta corta. Los LLM han hecho que los agentes entiendan mucho mejor la pregunta. No han cambiado cuánto puede retener una persona mientras escucha.

Empieza por la tarea, no por la personalidad

Antes de escribir un saludo o elegir una voz, anota las dos o tres tareas que el agente tiene que completar y qué significa «terminado» en cada una. «Cambiar una cita» está terminado cuando la nueva hora está en el calendario y la persona la ha oído repetida. «Responder preguntas de facturación» no es una tarea. «Explicar un cargo de la última factura y ofrecer un reembolso si está duplicado» sí lo es.

Para cada tarea, apunta la información que necesita el agente, de dónde sale (quien llama, tu CRM, una herramienta) y qué no puede hacer el agente. Esa lista se convierte en las instrucciones del agente y en las descripciones de sus herramientas. La personalidad puede venir después. Un agente simpático que no encuentra el pedido sigue siendo el agente equivocado.

Escribe para el oído

Las respuestas habladas piden hábitos distintos de las escritas:

  • Una pregunta por turno. «¿Cuál es tu fecha de nacimiento y el código postal de la cuenta?» recibe media respuesta. Pregunta una cosa y luego la otra.
  • La respuesta, primero. «Tu pedido salió el martes y llega el viernes» es mejor que una frase que empieza con los datos de seguimiento y llega a la fecha al final.
  • Pocas opciones. Una regla práctica es tres como máximo; con la cuarta, la persona ya ha olvidado la primera. Si hay más, haz una pregunta abierta y deja que el modelo de lenguaje interprete la respuesta.
  • Sin formato. El markdown, las viñetas y los emojis se leen en voz alta o se pierden. Dile al modelo que está escribiendo para voz.

Los números, los códigos y los nombres son lo más delicado. Sonic lee bien por sí solo las formas escritas habituales: precios como $19.99, fechas como 04/20/2025, teléfonos como (415) 555-1212. Para un código de confirmación que hay que leer carácter a carácter, envuélvelo en una etiqueta <spell>. Si el modelo pronuncia mal el nombre de un producto o de un lugar, añádelo una vez a un diccionario de pronunciación en vez de pelearte con él en cada prompt. Nuestros consejos de prompting incluyen un prompt de sistema inicial para voz escrita por un LLM que cubre estas reglas; es un buen primer borrador del tuyo.

Prueba las cadenas que de verdad oye quien llama. Un agente que suena genial leyendo un saludo puede destrozar «tu saldo es de $1,204.50, con vencimiento el 11/03».

Diseña el tiempo

En una conversación, las personas se pasan el turno en unos 200 milisegundos (Stivers et al., 2009). Un agente que espera un segundo entero para asegurarse de que la persona ha terminado suena lento. Uno que salta en cada pausa interrumpe a quien todavía está pensando.

Esa decisión le corresponde a la detección de turnos, no a un temporizador de silencio fijo. Ink, nuestro modelo de voz a texto, detecta los turnos por el significado de lo dicho además de por el audio. Puede emitir una señal temprana cuando la persona probablemente ha terminado, para que tu agente empiece a preparar la respuesta, y retirarla si la persona sigue hablando. Nuestra guía de detección de actividad de voz y de turnos entra en más detalle.

Hay dos decisiones de tiempo más que son de diseño, no de ingeniería:

  • Di algo antes de un trabajo lento. Si una llamada a una herramienta tarda tres segundos, tres segundos de silencio suenan a fallo. Una frase corta, «Déjame buscar ese pedido», le dice a la persona que el agente la ha oído. En Managed Agents, las herramientas tienen un ajuste pre_tool_speech para esto.
  • Decide qué se puede interrumpir. La gente interrumpe constantemente y, por lo general, el agente debería callarse y escuchar. Un aviso legal o la repetición de un importe de pago son la excepción: termínalo y luego atiende la pregunta.

Confirma lo que importa, y solo eso

Confirmarlo todo es pesado. No confirmar nada es como un agente acaba reservando una cita con el dentista el martes equivocado. Ordena cada dato según lo que costaría un error:

  • Coste bajo: el nombre de la persona en el saludo, el motivo de la llamada. Confírmalo de forma implícita usándolo: «Claro, te ayudo con tu pedido».
  • Coste alto: fechas, importes, direcciones, números de cuenta y cualquier cosa que dispare una acción irreversible. Repítelo y espera un sí: «Es el jueves 8 de octubre a las 2:30 de la tarde. ¿Lo reservo?».

Los errores de reconocimiento se concentran en las mismas palabras: nombres de productos, nombres de calles, códigos de cuenta. Si los conoces de antemano, dáselos al reconocedor como keyterms para que los oiga bien desde el principio. Corregir una transcripción errónea después es más difícil que evitarla.

Dale a cada error un siguiente paso

La mayor parte del trabajo de diseño está en los caminos que salen mal. Planifica estos antes del lanzamiento:

SituaciónQué debe hacer el agente
No ha entendidoReformular la pregunta, de forma más concreta. No repetirla palabra por palabra.
No ha entendido dos vecesOfrecer una persona u otro canal. Un tercer «¿perdona?» es cuando la gente empieza a pulsar el cero sin parar.
SilencioInsistir una vez y luego ofrecer devolver la llamada o despedirse con educación.
Fuera de alcanceDecir con qué puede ayudar el agente y ofrecer una transferencia.
Ha fallado una herramientaDecir que el sistema no está disponible y dar el siguiente paso. No inventar nunca una respuesta.
Quien llama pide al agente que ignore sus instruccionesNegarse y seguir con la tarea. Pruébalo antes del lanzamiento.

Escribe la regla de los dos intentos de forma explícita en las instrucciones del agente. Los LLM tienen una paciencia infinita, y una paciencia infinita en una llamada se siente como una trampa.

Haz que la transferencia sea fácil de alcanzar

Todo agente necesita una forma de llegar a una persona, y quien llama debería poder pedirla en cualquier momento. En Managed Agents, la herramienta de sistema transfer_to_number envía la llamada a un número de teléfono o a una dirección SIP, con una condición en lenguaje natural para cada destino, como «The caller has a billing or payment question».

Ten claro qué tipo de transferencia tienes. En una transferencia en frío, la llamada va directa al destino y el agente se desconecta. En una transferencia en caliente, alguien pone al día a la persona que atiende antes de que se una quien llama. Las transferencias que Cartesia documenta hoy son en frío; la documentación de SIP trunking las describe como transferencias SIP REFER. Diseña para eso: haz que el agente le diga a la persona con quién la va a conectar y por qué y, si quien atiende necesita contexto, escribe un breve resumen en tu CRM con una herramienta webhook antes de la transferencia, para que nadie tenga que preguntar «¿y de qué se trata?».

Prueba con llamadas reales

Un guion leído en voz alta por el equipo que lo escribió siempre pasa la prueba. Quien llama de verdad no va a leer el guion. Antes de enviar tráfico real:

  • Reúne de 20 a 50 grabaciones o transcripciones reales de la cola que vas a automatizar y pásalas por el agente.
  • Incluye las difíciles: ruido de fondo, acentos, gente que cambia de idea a mitad de frase, gente que pide una persona en los primeros cinco segundos.
  • Puntúa resultados, no sensaciones. Managed Agents puede evaluar las llamadas terminadas con métricas personalizadas, que son jueces LLM que tú defines («¿Se resolvió el problema de quien llamó?»). También registra el tiempo hasta el primer byte de audio en el primer turno del agente de cada llamada.
  • Escucha tú mismo una muestra cada semana después del lanzamiento. Las transcripciones ocultan el tono, las pausas largas y los solapamientos con quien llama.

La guía para pilotar un call center con IA convierte esto en una ficha de evaluación para una cola. Para crear un agente que puedas probar así, empieza con Managed Agents y una cuenta gratuita en el playground de Cartesia.

Guías relacionadas

Preguntas frecuentes

¿Qué es el diseño de IA conversacional?

El diseño de IA conversacional consiste en decidir qué dice un agente de IA, cuándo lo dice, qué pregunta y qué pasa cuando la conversación sale mal. Incluye las instrucciones del agente, su redacción, cómo confirma la información, cómo se recupera de los malentendidos y cuándo pasa la llamada a una persona. En los agentes de voz también incluye el tiempo: cuándo empezar a hablar, cómo gestionar las interrupciones y cómo leer en voz alta números y códigos.

¿En qué se diferencia diseñar un agente de voz de diseñar un chatbot?

Quien llama no puede volver atrás, leer en diagonal ni pulsar un botón. Todo tiene que funcionar a la primera, en orden y en tiempo real. Los agentes de voz necesitan turnos más cortos, una pregunta cada vez, repetir en voz alta códigos y números, y un plan para los errores de reconocimiento de voz y las interrupciones que un chatbot de texto nunca ve. El silencio también importa: una pausa de un segundo en una llamada suena a confusión, y la misma pausa en un chat pasa desapercibida.

¿Qué hace un diseñador de conversaciones?

Un diseñador de conversaciones define las tareas que el agente debe completar, escribe las preguntas y respuestas, decide cómo confirma los datos y se recupera de los errores, fija las reglas para pasar la llamada a una persona y prueba el resultado con conversaciones reales. En los agentes basados en LLM, gran parte del trabajo pasa de escribir cada frase a escribir instrucciones, descripciones de herramientas y casos de prueba que limitan lo que dice el modelo.

¿Cuáles son los principios del diseño de IA conversacional?

Diseña en torno a la tarea que quien llama quiere hacer. Haz turnos cortos y pregunta una cosa cada vez. Confirma solo los datos que salen caros si se equivocan. Dale a cada error un siguiente paso y no encierres a nadie en un bucle. Haz que pasar a una persona sea fácil. Prueba con grabaciones y personas reales, no solo con un guion leído por el equipo que lo escribió.

¿Cuánto debe tardar en responder un agente de voz?

En una conversación, las personas se turnan con pausas de unos 200 milisegundos, así que un agente debería empezar a responder bastante antes de un segundo después de que la persona deje de hablar. Si una llamada a una herramienta va a tardar más, haz que el agente diga primero una frase corta («Déjame consultar ese pedido») para que la persona sepa que la ha oído.