Aprende

IA de voz en infraestructura propia: qué es y cómo funciona

Rene, Kabir Goel 
IA de voz en infraestructura propia: qué es y cómo funciona

Algunos compradores no pueden usar una API de voz alojada, cueste lo que cueste. Organismos públicos, hospitales, bancos y contratistas de defensa compran IA de voz con una condición: el audio permanece dentro de su perímetro. La IA de voz en infraestructura propia permite cumplirla y cambia lo que debes evaluar antes de comprar.

Esta página explica qué es, qué debe ejecutarse realmente en tu hardware, dónde se sitúa entre una API en la nube y un entorno aislado y cómo evaluar proveedores. Termina con el enfoque de Cartesia, incluido el despliegue en infraestructura propia totalmente aislado que sustenta los AI Voice Agents de ServiceNow.

¿Qué es la IA de voz en infraestructura propia?

Es software de voz que se ejecuta en infraestructura que tu organización posee y controla. El proveedor entrega los modelos y tu equipo los opera en tus servidores, tu centro de datos o una cuenta de nube cuyas claves controlas. Nada de una llamada en directo, su audio o su transcripción tiene que pasar por la infraestructura del proveedor.

Se diferencia del despliegue habitual que conoce la mayoría. En una API en la nube, transmites audio al proveedor, este ejecuta los modelos y el audio y las transcripciones quedan sujetos a sus condiciones de servicio. Ese intercambio es adecuado para muchos productos y erróneo para otros. Si el audio es una sesión informativa clasificada, una sesión de terapia o una llamada de la que un regulador puede exigir copias, “el proveedor dice que lo elimina” no siempre es una respuesta aceptable.

Aquí, “IA de voz” significa un flujo de voz en tiempo real. Un agente construido sobre él tiene cuatro partes:

ParteQué hace¿Puede ejecutarse en infraestructura propia?
Voz a texto en streamingTranscribe mientras la persona aún hablaSí
Detección de turnosDecide cuándo ha terminado la personaSí
Modelo de lenguaje y herramientasElabora la respuesta y llama a tus sistemasSí, tú los eliges
Texto a voz en streamingPronuncia la respuesta mientras aún se generaSí

Todas pueden ejecutarse dentro de tu perímetro. Siempre has podido elegir el modelo de lenguaje. Las piezas que los proveedores suelen reservarse son los modelos de voz, y poder alojarlos dentro de tu red es una diferencia real entre proveedores.

Por qué las empresas despliegan IA de voz en infraestructura propia

Tres motivos aparecen una y otra vez:

Soberanía y residencia de datos. Algunos contratos y jurisdicciones exigen que determinados datos nunca salgan de un límite físico o legal bajo tu control. Una API en la nube transmite audio a quien la opera. La infraestructura propia mantiene ese límite en tus equipos.

Cumplimiento. Los compradores regulados relacionan los despliegues con marcos como HIPAA, RGPD y PCI. La infraestructura propia no garantiza por sí sola el cumplimiento, pero facilita la auditoría. El recorrido de los datos empieza y termina en infraestructura que puedes mostrar a un auditor.

Latencia y control. Al ejecutar modelos en tu red, eliminas un viaje de ida y vuelta al proveedor y no heredas sus límites de solicitudes. En un agente de voz, el tiempo de respuesta es parte del producto. Las personas se ceden el turno en unos 200 milisegundos (Stivers et al., 2009) y un segundo de silencio se percibe como vacilación. Por eso también existe el extremo de este espectro, ejecutar modelos en el dispositivo, sin red ni infraestructura compartida.

El espectro de despliegue

“Nube o infraestructura propia” es en realidad un espectro de quién opera cada pieza. La mayoría de los despliegues empresariales encaja en una de estas opciones:

DespliegueDónde se ejecutan los modelosQuién los operaRecorrido de los datos
API en la nubeNube del proveedorProveedorEl audio sale de tu red
VPC, nube privadaTu cuenta de nube, tu regiónTú, con soporte del proveedorEl audio permanece en tu cuenta de nube
Infraestructura propiaTu centro de datosTúEl audio permanece en tu red
Infraestructura propia aisladaTu centro de datos, sin ruta a internetTúNada sale, por diseño
En el dispositivoEl propio terminalTúNada sale del hardware

Dos observaciones ahorran tiempo. Primero, una VPC no es infraestructura propia en tus instalaciones. El hardware es tuyo, pero el centro de datos no. Suele bastar cuando la restricción es contractual. Segundo, pregunta a cada proveedor qué incluye su oferta “on-prem”. Algunos se refieren a un contenedor que ejecutas tú, pero que sigue comunicándose con ellos para licencias o actualizaciones. Es un despliegue conectado y no satisface requisitos de aislamiento total.

Cómo evaluar a un proveedor de IA de voz en infraestructura propia

Estas preguntas distinguen las ofertas reales de las promesas comerciales:

  1. ¿El aislamiento es real? ¿Puede la inferencia ejecutarse sin ninguna conexión saliente o sale algo de la red durante la conversación, como licencias, telemetría o una llamada obligatoria a la nube?
  2. ¿Los modelos locales son los mismos que los de la nube? Algunos proveedores entregan un modelo distinto y más antiguo que el de su API. Si las demos que te gustaron usaban el modelo de la nube, pregunta qué binario estás comprando.
  3. ¿Qué latencia obtienes en tu entorno? Las cifras del proveedor se miden en su hardware. Pide una prueba en el tuyo, con tu concurrencia y en el percentil 99, no solo la mediana.
  4. ¿Quién actualiza los modelos y cómo? Infraestructura propia no debe significar versiones congeladas. Pregunta cómo llegan las actualizaciones, si puedes fijar versiones y cómo afecta un cambio de modelo a tus instrucciones y voces ajustadas.
  5. ¿Qué documentación de cumplimiento hay? SOC 2 Type II, un BAA que puedas firmar, un DPA publicado y condiciones de residencia de datos. Si el proveedor no puede entregarlos, el modelo de despliegue no salvará el acuerdo.
  6. ¿Todo el flujo queda dentro? Un modelo TTS local junto a un STT que no lo es deja un hueco en el despliegue. Pregunta por el flujo completo, incluida la detección de turnos.

Cómo lo hace Cartesia

Los modelos de Cartesia se basan en modelos de espacio de estados, una arquitectura diseñada para inferencia en tiempo real. Los mismos modelos están disponibles en la nube, en infraestructura propia y en el dispositivo. En concreto:

  • Sonic, nuestro modelo de texto a voz, con latencia de modelo inferior a 90 ms, primer puesto en pruebas de escucha a ciegas de terceros y 44 idiomas, se despliega en tu centro de datos, incluidos entornos aislados; en tu VPC en AWS, GCP o Azure; o mediante una licencia OEM para integrarlo directamente en tu producto.
  • Ink, nuestro modelo de voz a texto en streaming con detección de turnos nativa, tiene las mismas opciones de despliegue.
  • Para los AI Voice Agents de ServiceNow, Cartesia proporciona los modelos de voz, el motor de inferencia y la coordinación en un despliegue local totalmente aislado, junto con cumplimiento de SOC 2 Type II, HIPAA, RGPD y PCI.
  • Rasa incluye las opciones de despliegue local de Cartesia en su oferta empresarial. Blue Machines desarrolló con nosotros una arquitectura de despliegue para entornos regulados.
  • En el extremo del espectro, Edge es nuestra biblioteca de código abierto, con licencia Apache 2.0, para ejecutar modelos de espacio de estados en el dispositivo.

Los despliegues en infraestructura propia y OEM están disponibles mediante contratos empresariales. Habla con nosotros sobre tus requisitos o empieza en la nube con precios de autoservicio y traslada el despliegue más adelante. Como los modelos son los mismos, la migración cambia el despliegue y no exige reconstruir la solución.

Preguntas frecuentes

¿Qué es la IA de voz en infraestructura propia?

Es software de voz que se ejecuta en hardware controlado por tu organización, dentro de tu red. El reconocimiento de voz, texto a voz y los modelos que deciden qué decir funcionan en tu centro de datos o nube privada, de modo que el audio y las transcripciones de las llamadas nunca pasan por los servidores de un proveedor.

¿Infraestructura propia significa aislamiento de internet?

No. Infraestructura propia significa que el software se ejecuta en tu hardware. Un entorno aislado, o air-gapped, no tiene ninguna ruta hacia internet público. Lo primero describe la ubicación del despliegue; lo segundo, la política de red más estricta que puedes aplicarle. Las organizaciones con requisitos de soberanía suelen referirse a ese aislamiento cuando piden infraestructura propia.

¿Puede texto a voz ejecutarse en infraestructura propia?

Sí. Sonic, el modelo de texto a voz de Cartesia, puede desplegarse dentro de tu centro de datos, incluidos entornos aislados de internet, o en tu propia VPC en AWS, GCP o Azure. Lo mismo ocurre con Ink, el modelo de voz a texto en streaming de Cartesia. Ambos están disponibles mediante contratos empresariales.

¿Qué certificaciones de cumplimiento importan para la IA de voz?

Busca SOC 2 Type II, elegibilidad para HIPAA con un BAA firmado y cumplimiento del RGPD. Pregunta cómo gestiona el proveedor la retención de datos. Cartesia tiene certificación SOC 2 Type II, es elegible para HIPAA con BAA disponibles, cumple el RGPD y ofrece retención cero en servicios elegibles. Su anexo de protección de datos está publicado en cartesia.ai/legal/dpa.

¿Necesito infraestructura totalmente propia para mantener privado el audio de las llamadas?

No siempre. Si la restricción es contractual en lugar de física, un despliegue en VPC o la retención cero de datos pueden satisfacerla con menos carga operativa. La infraestructura propia justifica su coste cuando el audio no puede salir físicamente de tu perímetro o cuando lo exige un regulador o contrato.