Algunos compradores no pueden usar una API de voz alojada, cueste lo que cueste. Organismos públicos, hospitales, bancos y contratistas de defensa compran IA de voz con una condición: el audio permanece dentro de su perímetro. La IA de voz en infraestructura propia permite cumplirla y cambia lo que debes evaluar antes de comprar.
Esta página explica qué es, qué debe ejecutarse realmente en tu hardware, dónde se sitúa entre una API en la nube y un entorno aislado y cómo evaluar proveedores. Termina con el enfoque de Cartesia, incluido el despliegue en infraestructura propia totalmente aislado que sustenta los AI Voice Agents de ServiceNow.
¿Qué es la IA de voz en infraestructura propia?
Es software de voz que se ejecuta en infraestructura que tu organización posee y controla. El proveedor entrega los modelos y tu equipo los opera en tus servidores, tu centro de datos o una cuenta de nube cuyas claves controlas. Nada de una llamada en directo, su audio o su transcripción tiene que pasar por la infraestructura del proveedor.
Se diferencia del despliegue habitual que conoce la mayoría. En una API en la nube, transmites audio al proveedor, este ejecuta los modelos y el audio y las transcripciones quedan sujetos a sus condiciones de servicio. Ese intercambio es adecuado para muchos productos y erróneo para otros. Si el audio es una sesión informativa clasificada, una sesión de terapia o una llamada de la que un regulador puede exigir copias, “el proveedor dice que lo elimina” no siempre es una respuesta aceptable.
Aquí, “IA de voz” significa un flujo de voz en tiempo real. Un agente construido sobre él tiene cuatro partes:
| Parte | Qué hace | ¿Puede ejecutarse en infraestructura propia? |
|---|---|---|
| Voz a texto en streaming | Transcribe mientras la persona aún habla | Sí |
| Detección de turnos | Decide cuándo ha terminado la persona | Sí |
| Modelo de lenguaje y herramientas | Elabora la respuesta y llama a tus sistemas | Sí, tú los eliges |
| Texto a voz en streaming | Pronuncia la respuesta mientras aún se genera | Sí |
Todas pueden ejecutarse dentro de tu perímetro. Siempre has podido elegir el modelo de lenguaje. Las piezas que los proveedores suelen reservarse son los modelos de voz, y poder alojarlos dentro de tu red es una diferencia real entre proveedores.
Por qué las empresas despliegan IA de voz en infraestructura propia
Tres motivos aparecen una y otra vez:
Soberanía y residencia de datos. Algunos contratos y jurisdicciones exigen que determinados datos nunca salgan de un límite físico o legal bajo tu control. Una API en la nube transmite audio a quien la opera. La infraestructura propia mantiene ese límite en tus equipos.
Cumplimiento. Los compradores regulados relacionan los despliegues con marcos como HIPAA, RGPD y PCI. La infraestructura propia no garantiza por sí sola el cumplimiento, pero facilita la auditoría. El recorrido de los datos empieza y termina en infraestructura que puedes mostrar a un auditor.
Latencia y control. Al ejecutar modelos en tu red, eliminas un viaje de ida y vuelta al proveedor y no heredas sus límites de solicitudes. En un agente de voz, el tiempo de respuesta es parte del producto. Las personas se ceden el turno en unos 200 milisegundos (Stivers et al., 2009) y un segundo de silencio se percibe como vacilación. Por eso también existe el extremo de este espectro, ejecutar modelos en el dispositivo, sin red ni infraestructura compartida.
El espectro de despliegue
“Nube o infraestructura propia” es en realidad un espectro de quién opera cada pieza. La mayoría de los despliegues empresariales encaja en una de estas opciones:
| Despliegue | Dónde se ejecutan los modelos | Quién los opera | Recorrido de los datos |
|---|---|---|---|
| API en la nube | Nube del proveedor | Proveedor | El audio sale de tu red |
| VPC, nube privada | Tu cuenta de nube, tu región | Tú, con soporte del proveedor | El audio permanece en tu cuenta de nube |
| Infraestructura propia | Tu centro de datos | Tú | El audio permanece en tu red |
| Infraestructura propia aislada | Tu centro de datos, sin ruta a internet | Tú | Nada sale, por diseño |
| En el dispositivo | El propio terminal | Tú | Nada sale del hardware |
Dos observaciones ahorran tiempo. Primero, una VPC no es infraestructura propia en tus instalaciones. El hardware es tuyo, pero el centro de datos no. Suele bastar cuando la restricción es contractual. Segundo, pregunta a cada proveedor qué incluye su oferta “on-prem”. Algunos se refieren a un contenedor que ejecutas tú, pero que sigue comunicándose con ellos para licencias o actualizaciones. Es un despliegue conectado y no satisface requisitos de aislamiento total.
Cómo evaluar a un proveedor de IA de voz en infraestructura propia
Estas preguntas distinguen las ofertas reales de las promesas comerciales:
- ¿El aislamiento es real? ¿Puede la inferencia ejecutarse sin ninguna conexión saliente o sale algo de la red durante la conversación, como licencias, telemetría o una llamada obligatoria a la nube?
- ¿Los modelos locales son los mismos que los de la nube? Algunos proveedores entregan un modelo distinto y más antiguo que el de su API. Si las demos que te gustaron usaban el modelo de la nube, pregunta qué binario estás comprando.
- ¿Qué latencia obtienes en tu entorno? Las cifras del proveedor se miden en su hardware. Pide una prueba en el tuyo, con tu concurrencia y en el percentil 99, no solo la mediana.
- ¿Quién actualiza los modelos y cómo? Infraestructura propia no debe significar versiones congeladas. Pregunta cómo llegan las actualizaciones, si puedes fijar versiones y cómo afecta un cambio de modelo a tus instrucciones y voces ajustadas.
- ¿Qué documentación de cumplimiento hay? SOC 2 Type II, un BAA que puedas firmar, un DPA publicado y condiciones de residencia de datos. Si el proveedor no puede entregarlos, el modelo de despliegue no salvará el acuerdo.
- ¿Todo el flujo queda dentro? Un modelo TTS local junto a un STT que no lo es deja un hueco en el despliegue. Pregunta por el flujo completo, incluida la detección de turnos.
Cómo lo hace Cartesia
Los modelos de Cartesia se basan en modelos de espacio de estados, una arquitectura diseñada para inferencia en tiempo real. Los mismos modelos están disponibles en la nube, en infraestructura propia y en el dispositivo. En concreto:
- Sonic, nuestro modelo de texto a voz, con latencia de modelo inferior a 90 ms, primer puesto en pruebas de escucha a ciegas de terceros y 44 idiomas, se despliega en tu centro de datos, incluidos entornos aislados; en tu VPC en AWS, GCP o Azure; o mediante una licencia OEM para integrarlo directamente en tu producto.
- Ink, nuestro modelo de voz a texto en streaming con detección de turnos nativa, tiene las mismas opciones de despliegue.
- Para los AI Voice Agents de ServiceNow, Cartesia proporciona los modelos de voz, el motor de inferencia y la coordinación en un despliegue local totalmente aislado, junto con cumplimiento de SOC 2 Type II, HIPAA, RGPD y PCI.
- Rasa incluye las opciones de despliegue local de Cartesia en su oferta empresarial. Blue Machines desarrolló con nosotros una arquitectura de despliegue para entornos regulados.
- En el extremo del espectro, Edge es nuestra biblioteca de código abierto, con licencia Apache 2.0, para ejecutar modelos de espacio de estados en el dispositivo.
Los despliegues en infraestructura propia y OEM están disponibles mediante contratos empresariales. Habla con nosotros sobre tus requisitos o empieza en la nube con precios de autoservicio y traslada el despliegue más adelante. Como los modelos son los mismos, la migración cambia el despliegue y no exige reconstruir la solución.