Un agente de voz de IA descuelga el teléfono, escucha lo que quiere la persona y actúa: reserva una cita, consulta un pedido, responde una pregunta o transfiere a alguien antes de que la conversación se atasque. Los chatbots hacen ese trabajo leyendo y escribiendo. Un agente de voz lo hace sobre audio en directo, mientras quien llama aún está a mitad de frase.
Esa diferencia de tiempo explica buena parte de la ingeniería. Esta página describe qué es un agente de voz, cómo funciona su flujo, qué dificulta crearlo y las dos formas de hacerlo con Cartesia.
¿Qué es un agente de voz de IA?
Es software que mantiene una conversación hablada y actúa. Transcribe lo que dice la persona, decide qué hacer, llama a herramientas como un calendario o un sistema de pedidos y responde en voz alta con el resultado. Pertenece a la categoría más amplia de “IA conversacional”, aplicada al habla en tiempo real. Tenemos una descripción general de la IA conversacional para toda la categoría.
Se confunde con dos sistemas cercanos:
| Sistema | Qué hace | En qué se diferencia |
|---|---|---|
| IVR de tonos o menús | Reproduce menús y dirige llamadas | No comprende el lenguaje; la persona recorre el menú, no al revés |
| Chatbot de texto | Lee y escribe texto | No usa audio en directo y puede hacer pausas entre turnos sin que la persona lo note |
Un agente de voz puede entender una solicitud que los menús nunca previeron y debe responder mientras la persona sigue en línea. Si falla el ritmo, las personas hablan por encima de él, esperan durante silencios incómodos o cuelgan.
Cómo funciona un agente de voz
El ciclo tiene cuatro etapas. En los buenos sistemas se ejecutan a la vez en lugar de una tras otra:
| Etapa | Tarea | Qué vigilar |
|---|---|---|
| Voz a texto en streaming | Transcribir el audio a medida que llega | Precisión con tus acentos, códecs telefónicos y ruido; no descartar el silencio que necesita el detector de turnos |
| Detección de turnos | Decidir cuándo ha terminado la idea | Una pausa puede significar “estoy pensando” o “he terminado”; un tiempo de espera fijo trata ambas igual |
| LLM y herramientas | Planificar la respuesta y llamar al calendario o sistema de pedidos | La latencia de herramientas se suma directamente a la espera de la persona |
| Texto a voz | Pronunciar la respuesta mientras se genera | Empezar antes de que exista toda la frase y gestionar bien las interrupciones |
La persona experimenta una cifra: el tiempo entre terminar su frase y oír la respuesta. Todas las etapas contribuyen. Un modelo TTS que tarda menos de un segundo no salva un agente cuyas herramientas tardan tres segundos. Un LLM rápido no salva un reconocedor que confunde el número de cuenta. Mide todo el ciclo. Ink de Cartesia cubre las dos primeras etapas con un modelo, mediante transcripción en streaming y detección nativa de turnos. Sonic es la cuarta, un modelo de texto a voz que ocupa el primer puesto en pruebas de escucha a ciegas, con latencia inferior a 90 ms y más de 40 idiomas. El modelo de lenguaje intermedio lo eliges tú.
Qué dificulta crear agentes de voz
Conectar el flujo es la parte fácil. Los agentes suelen fallar en tres comportamientos:
Gestión de turnos. Las personas no hablan siempre con frases completas. Dicen “mi dirección es…” y paran para consultarla. Los estudios de conversación entre idiomas encuentran que las personas se ceden el turno en unos 200 milisegundos (Stivers et al., 2009). Un agente que espera un segundo entero para estar seguro ya ha perdido el ritmo; uno que entra ante cualquier pausa interrumpe. Decidir si una pausa significa pensar o terminar es un problema propio. Nuestra guía de detección de actividad de voz y turnos lo explica.
Interrupciones. Las personas cambian de idea durante la respuesta: “mejor el jueves”. Un agente útil deja de hablar, incorpora la corrección y continúa. Eso requiere cancelar la generación de texto y el audio ya almacenado para reproducirse en el altavoz de quien llama. Es tanto un problema del cliente como del servidor.
Recuperación. El reconocedor oirá algo mal. Una llamada a una herramienta agotará el tiempo de espera. El agente necesita un siguiente paso: pedir confirmación una vez, reintentar o transferir a una persona antes de que quien llama repita lo mismo por tercera vez. Los agentes que solo saben acertar fallan de forma evidente.
Evalúa con tus llamadas, no con una demo
La demo de cada proveedor funciona porque se escribió para la demo. Quienes te llaman tienen sus acentos, su conexión telefónica y tu terminología. Antes de dirigir tráfico real, pasa un lote de llamadas grabadas o de prueba por el agente y evalúa la conversación:
- ¿Deja terminar, incluidas ideas añadidas como “y, eh, el segundo”?
- ¿Empieza a responder pronto tras una respuesta completa, sin un segundo vacío?
- Cuando la persona interrumpe, ¿se detiene realmente el audio?
- Cuando oye algo mal, ¿confirma o transfiere en lugar de adivinar?
- Ante una acción con consecuencias, como cancelar una reserva o cambiar un pedido, ¿confirma antes de hacerla?
La guía de pruebas piloto para centros de llamadas con IA convierte esto en criterios para una cola de soporte. La guía de recepcionistas de IA incluye una tabla de aceptación con un caso de inyección de instrucciones.
Dos formas de crear uno con Cartesia
Managed Agents (/agents) conecta el ciclo por ti. Elige tu LLM, conecta herramientas y transferencias, añade una base de conocimiento y consigue un número de teléfono con pocos clics. Cartesia ejecuta la infraestructura de streaming. Es la vía rápida para pasar de cero a un agente que puedas probar.
La API te da las piezas. Sonic para hablar, Ink para transcripción en streaming y detección de turnos, y tu LLM en medio. Tu código controla el ciclo. Úsala cuando necesites controlar el modelo, el lenguaje de programación o el despliegue. La introducción a Managed Agents explica ambas vías y qué gestiona cada una.
Ambas usan los mismos modelos. Se basan en una arquitectura de modelos de espacio de estados que permite transmitir con estas latencias. No necesitas preocuparte por ella hasta que te importe su efecto en la factura.
Dónde se usan los agentes de voz
En atención al cliente y mesas de ayuda, recepción y citas, automatización de centros de llamadas y experiencias interactivas como personajes y juguetes. Decagon, ServiceNow, Quora, Retell y EliseAI crean productos de voz con Cartesia. La página de clientes contiene los detalles.