“IA de voz” se ha convertido en un término que engloba cuatro negocios distintos: proveedores de modelos de voz, plataformas que combinan esos modelos en agentes, servicios de voz en la nube y proyectos de código abierto. Esta guía explica quién es quién a finales de 2026 para que puedas seleccionar las dos o tres opciones que encajan con tu tarea en vez de probar una docena.
Somos una de las empresas de esta lista y el artículo lo indica. Cuando una afirmación importa, enlaza a una clasificación o página de producto que puedes consultar.
Proveedores de modelos de voz
Estas empresas entrenan sus propios modelos de voz y los venden mediante API. Si integras voz en un producto, esta es la capa que contratas.
Cartesia, nuestra empresa, desarrolla modelos de voz en tiempo real con una arquitectura de modelos de espacio de estados, la línea de investigación que nuestro equipo fundador impulsó en Stanford AI Lab. Sonic es nuestro modelo de texto a voz. Transmite audio mientras lo genera, con una latencia de modelo inferior a 90 ms, más de 40 idiomas y el primer puesto en pruebas de escucha a ciegas en VoiceArena y Artificial Analysis. Ink es nuestro modelo de voz a texto en streaming con detección de turnos integrada. Managed Agents permite crear agentes de voz para producción. Decagon, ServiceNow, Quora, Retell y EliseAI desarrollan sobre la plataforma. Consulta clientes y precios.
ElevenLabs es la mayor marca dirigida al consumidor en este ámbito, con una biblioteca de voces, clonación, doblaje y un estudio para creadores. Ahora su página de inicio también da protagonismo a los agentes de voz. Su fortaleza es la producción creativa. Para cargas de agentes en tiempo real, compara directamente el tiempo hasta el primer audio. Nuestra comparación con ElevenLabs explica las diferencias entre plataformas.
Deepgram vende API de voz a texto y texto a voz con un enfoque empresarial. Su reputación se basa en la transcripción rápida a gran escala. Evalúa su TTS por separado de su STT.
PlayHT lleva años ofreciendo API de TTS. Su sitio no cargó cuando lo comprobamos el 24 de septiembre de 2026. Confirma que el servicio funciona y tiene soporte antes de desarrollar sobre él.
Speechify es conocido sobre todo como asistente de lectura para escuchar documentos. La empresa afirma tener más de 60 millones de usuarios. Sus productos de estudio y API son independientes de la aplicación de lectura.
Murf AI y WellSaid Labs se dirigen a la producción de locuciones. Murf ofrece un editor que convierte guiones en locuciones y ahora también promociona agentes conversacionales. WellSaid se centra en procesos de narración empresarial.
Plataformas de agentes de voz
Estas empresas, en su mayoría, no entrenan modelos de voz. Coordinan reconocimiento de voz, modelos de lenguaje y síntesis de voz para crear agentes telefónicos o de aplicaciones. Venden la infraestructura de telefonía, coordinación y observabilidad.
Vapi es una plataforma para desarrolladores que permite componer agentes de voz con piezas independientes del proveedor. Retell AI crea agentes de voz para producción y usa voces de Cartesia en su sistema. Bland AI se centra en agentes que realizan y atienden llamadas telefónicas a gran escala. LiveKit vende infraestructura de audio y vídeo en tiempo real, la base WebRTC de muchos productos de voz.
Si quieres un agente sin montar el flujo por tu cuenta, empieza aquí. Si necesitas controlar los propios modelos, contrata a los proveedores anteriores e intégralos tú.
Servicios de voz en la nube
Google Cloud, con Speech-to-Text y Text-to-Speech, Microsoft Azure AI Speech y Amazon Polly son los servicios de voz establecidos. Tienen la distribución más amplia, herramientas avanzadas de cumplimiento y una larga trayectoria. Las empresas emergentes los han ido superando en calidad de voz y latencia conversacional. Si tu organización ya trabaja en una nube, estos servicios presentan menos obstáculos de adopción.
OpenAI ofrece voz mediante sus API, incluida una API Realtime para sesiones de voz a voz. Sus modelos también sustentan el modo de voz de ChatGPT.
Código abierto
Fish Audio publica modelos de voz de pesos abiertos, Fish Speech, además de una plataforma alojada. Whisper sigue siendo el modelo abierto de referencia para voz a texto. Proyectos como Piper y F5-TTS cubren texto a voz con alojamiento propio. El código abierto te da control y permite mantener los datos cerca a cambio de operar tú la infraestructura. La latencia y la calidad de voz varían mucho según la configuración.
Cómo elegir
Primero relaciona el proveedor con la tarea; después mira la clasificación. Un agente en tiempo real necesita endpoints de streaming y poco tiempo hasta el primer audio. Prueba tu propio guion y recorrido de red desde tu región de despliegue. La narración grabada necesita un proceso de edición y derechos comerciales más que 90 milisegundos.
Después haz pruebas reales. Usa los mismos guiones en ambos sistemas, con números de cuenta, abreviaturas y respuestas interrumpidas. Nuestra guía de agentes de voz incluye los criterios de evaluación para cargas de agentes. Nuestro centro de comparaciones ofrece comparaciones directas con los competidores citados.
Si quieres escuchar el TTS que ocupa el primer puesto antes de leer otra comparación, el generador de voz ejecuta Sonic en tu navegador sin registro.