Una plataforma de agentes de voz con IA contesta el teléfono por ti: escucha, entiende qué quiere quien llama, consulta tus sistemas, responde en voz alta y te cobra por minuto. Ya hay decenas, y sus páginas de precios están escritas para que compararlas sea difícil. Esta página compara las ocho que con más probabilidad tendrás en la lista corta, según lo que gestiona cada una y lo que cuesta de verdad un minuto.
La versión breve: si quieres un único precio que incluya los modelos, mira Bland. Si quieres elegir cada modelo tú mismo, mira Vapi o Retell. Si quieres escribir el agente como código, usa LiveKit Agents o Pipecat. Si la calidad de la voz y el tiempo de respuesta deciden si quien llama sigue en la línea, prueba Cartesia Managed Agents, que ejecuta los modelos de voz que ocupan el primer puesto en clasificaciones independientes.
Desarrollamos Cartesia, así que ten en cuenta nuestro punto de vista. Todos los precios de la competencia salen de la propia página de precios de cada proveedor, consultada el 3 de octubre de 2026.
Qué hace una plataforma de agentes de voz
Todo agente de voz ejecuta el mismo ciclo. La transcripción en streaming convierte la voz de quien llama en texto mientras habla. Un detector de turnos decide cuándo ha terminado. Un modelo de lenguaje planifica la respuesta y llama a herramientas, como un calendario o una consulta de pedidos. El texto a voz devuelve la respuesta en streaming. Nuestra guía sobre cómo funcionan los agentes de voz explica el ciclo en detalle.
Una plataforma aloja ese ciclo y añade las piezas que nadie quiere construir dos veces: números de teléfono, transferencias de llamadas, una interfaz de configuración, registros de llamadas y evaluaciones. Un framework te da el mismo ciclo como código que despliegas tú. La decisión principal es cuánta parte del stack quieres controlar, más que qué proveedor eliges.
Las plataformas, una a una
Cartesia Managed Agents
Managed Agents combina Ink 2 para voz a texto, el LLM que elijas y Sonic 3.6 para la voz, según la documentación de Managed Agents. Los dos modelos de voz son nuestros. Ink 2 quedó primero en tasa de error de palabras en la clasificación de streaming de Artificial Analysis en junio de 2026 y predice él mismo el final de un turno, sin un detector de actividad de voz aparte. Sonic 3.6 quedó primero de 94 modelos en la Provider Voice Arena de Artificial Analysis en agosto de 2026.
Configuras un agente en el playground o por API, y puedes darle herramientas, una base de conocimiento y un número de teléfono. Las llamadas cuestan 0,06 $ por minuto en todos los planes, y un número proporcionado por Cartesia añade 0,014 $ por minuto. Durante un tiempo limitado, el uso del LLM está incluido para los agentes creados en el playground (precios). La simultaneidad va de 8 llamadas en Free a 60 en Scale.
Elígela cuando la voz es el producto: líneas de soporte, recepcionistas y cualquier llamada en la que una respuesta lenta o robótica hace que quien llama cuelgue. Comprueba si tu CRM o tu sistema de citas tiene integración; si no, el agente puede llegar a él con una herramienta webhook.
Vapi
Vapi es una plataforma para desarrolladores que montan un agente con las piezas que eligen. Según la página de precios de Vapi, el alojamiento cuesta 0,05 $ por minuto y los modelos (transcriptor, LLM, voz) se cobran a coste, así que la tarifa real depende de lo que elijas. La propia estimación de Vapi para 1.000 minutos sale en 82 $ a 129 $ al mes, unos 0,08 $ a 0,13 $ por minuto. El nivel gratuito incluye 5 $ de crédito y 4 llamadas simultáneas. Vapi eligió Cartesia como su proveedor de voz predeterminado en 2024.
Elígela cuando quieres control sobre cada modelo y no te importa leer el equivalente a tres o cuatro facturas en partidas.
Retell AI
Retell vende una plataforma low-code orientada a automatizar centros de llamadas. Su página de precios indica de 0,07 $ a 0,31 $ por minuto en pago por uso, con 20 llamadas simultáneas incluidas. La estimación por defecto se reparte en 0,055 $ de infraestructura de voz de Retell, 0,04 $ del LLM y 0,015 $ de telefonía, unos 0,11 $ en total. Retell ofrece voces de varios proveedores, Cartesia entre ellos, e informa de un tiempo hasta el primer audio de 2 a 3 veces más rápido con Cartesia que con el siguiente mejor proveedor de su plataforma.
Elígela cuando los flujos de llamada los van a crear y mantener personas que no son ingenieros.
Bland AI
Bland lo cobra todo en un único número. La página de precios de Bland indica 0,14 $ por minuto en Start y 0,12 $ en Build (cuota de plataforma de 299 $ al mes), con el LLM, la voz a texto y el texto a voz incluidos, y la telefonía facturada aparte. Los planes Enterprise añaden despliegue on-prem o en VPC e ingenieros desplegados con tu equipo.
Elígela cuando una factura predecible importa más que elegir los modelos.
Synthflow
Synthflow se dirige a centros de contacto empresariales con un constructor sin código, telefonía propia y soporte de implantación. Su página de precios indica contratos empresariales desde 30.000 $ al año, según volumen de llamadas, simultaneidad e integraciones.
Elígela cuando quieres que un proveedor haga el despliegue contigo y tienes presupuesto para un contrato anual.
ElevenLabs Agents
ElevenAgents factura por minuto de llamada: cada plan incluye un bloque de minutos, y los minutos extra cuestan 0,08 $, o 0,16 $ cuando las llamadas superan tu límite de simultaneidad, según los precios de agentes de ElevenLabs. El LLM se factura aparte. Nuestro desglose de precios de ElevenLabs calcula una carga de 10.000 minutos.
Elígela cuando tu equipo ya usa ElevenLabs para trabajo creativo y quiere agentes en la misma cuenta. Para llamadas sensibles a la latencia, compara antes: en las mediciones de Coval de agosto de 2026, Sonic 3.5 dio el primer audio en 351 ms en el P90, mientras que todos los modelos de ElevenLabs probados tardaron más de un segundo.
LiveKit Agents
LiveKit es la infraestructura WebRTC de código abierto que hay debajo de muchos productos de voz, y LiveKit Agents es su framework para escribir el ciclo del agente en Python o Node. Puedes alojarlo tú o desplegarlo en LiveKit Cloud, que cobra 0,01 $ por minuto de sesión de agente a partir de la cuota incluida, con inferencia para los modelos más populares en la misma factura.
Elígela cuando tienes ingenieros y quieres control total sin gestionar servidores de medios. LiveKit colabora con Cartesia, y Sonic e Ink están disponibles en su facturación de inferencia.
Pipecat
Pipecat es un framework de Python de código abierto, creado por Daily, para construir agentes de voz y multimodales como una cadena de servicios. Es gratuito; pagas a los proveedores de modelos y lo alojas donde quieras.
Elígela cuando quieres el máximo control y las mínimas opiniones de plataforma. Nuestro tutorial de Pipecat construye un agente funcional con Ink y Sonic y muestra cómo la detección anticipada de turnos recorta casi medio segundo de cada respuesta.
Comparación lado a lado
| Plataforma | Tipo | Precio por minuto publicado (3 oct. 2026) | Modelos |
|---|---|---|---|
| Cartesia Managed Agents | Plataforma alojada | 0,06 $, más 0,014 $ por número de Cartesia | Ink 2 + tu LLM + Sonic 3.6 |
| Vapi | Plataforma alojada | 0,05 $ de alojamiento, más modelos a coste | A tu elección |
| Retell AI | Plataforma alojada | De 0,07 $ a 0,31 $ | A tu elección |
| Bland AI | Plataforma alojada | De 0,12 $ a 0,14 $, modelos incluidos | Incluidos |
| Synthflow | Plataforma empresarial | Contrato, desde 30.000 $ al año | Incluidos |
| ElevenLabs Agents | Plataforma alojada | 0,08 $, más el LLM | ElevenLabs + tu LLM |
| LiveKit Agents | Framework y nube | 0,01 $ de sesión, más modelos | A tu elección |
| Pipecat | Framework de código abierto | Gratis, más modelos y alojamiento | A tu elección |
Los precios publicados, por sí solos, orientan poco. Una plataforma de “0,05 $” con una voz premium y un LLM grande puede costar más que un paquete de “0,14 $”. Calcula la misma llamada en cada finalista: el mismo LLM, la misma calidad de voz, la misma telefonía.
Cómo elegir
Cuatro preguntas resuelven la mayoría de las decisiones:
- ¿Quién va a mantener el agente? Si es un equipo de operaciones, elige una plataforma con constructor visual (Retell, Synthflow, Bland o Managed Agents). Si son ingenieros, Vapi, LiveKit o Pipecat les resultarán menos limitantes.
- ¿Qué tan rápido responde el agente? Las personas se ceden el turno en unos 200 milisegundos, y una pausa de un segundo suena a línea muerta. Mide el tiempo desde la última palabra de quien llama hasta el primer audio del agente, en el percentil 90, en una línea telefónica real. Las medianas con audio limpio ocultan las llamadas lentas.
- ¿Cómo maneja las cadenas difíciles? Dicta un código de confirmación, una dirección y un número de teléfono a cada finalista. Los errores de transcripción en estos datos son los que acaban en reservas equivocadas.
- ¿Cuánto cuesta tu volumen? Multiplica tus minutos mensuales previstos por la tarifa total, con el LLM y la telefonía, y comprueba qué pasa cuando superas la simultaneidad del plan.
Después, haz un piloto. Nuestra guía de centros de llamadas con IA incluye un plan de piloto, y la guía de recepcionistas con IA cubre el caso de la pequeña empresa.
Prueba Cartesia Managed Agents
Puedes crear un agente y probarlo con una llamada en el playground de Cartesia con el plan gratuito, que incluye 1 $ de uso de agentes al mes. Si prefieres seguir con tu plataforma actual, Vapi, Retell, LiveKit y Pipecat admiten Sonic como voz del agente.