Aprenda

IA de voz on-premise: o que é e como funciona

Rene, Kabir Goel 
IA de voz on-premise: o que é e como funciona

Alguns compradores não podem usar uma API de voz hospedada, seja qual for o preço. Órgãos públicos, hospitais, bancos e fornecedores do setor de defesa compram IA de voz com uma condição: o áudio fica dentro do nosso perímetro. A IA de voz on-premise atende a essa condição e muda o que você deve avaliar antes de comprar.

Esta página explica o que é IA de voz on-premise, o que de fato precisa rodar no seu hardware, sua posição no espectro entre API em nuvem e isolamento de rede, e como avaliar fornecedores. Ao final, mostramos como a Cartesia faz isso, incluindo a implantação on-premise totalmente isolada por trás dos AI Voice Agents da ServiceNow.

O que é IA de voz on-premise?

IA de voz on-premise é um software de fala executado em infraestrutura que sua organização possui e controla. O fornecedor entrega os modelos; sua equipe os opera nos seus servidores, no seu data center ou em uma conta de nuvem cujas chaves você controla. Nada de uma chamada ao vivo, de seu áudio ou de sua transcrição precisa passar pela infraestrutura do fornecedor.

Isso contrasta com a implantação padrão que a maioria conhece: uma API em nuvem para a qual você transmite áudio, o fornecedor executa os modelos, e áudio e transcrições ficam sujeitos aos termos de serviço dele. Essa troca funciona para a maioria dos produtos e é inadequada para alguns. Se o áudio for uma reunião sigilosa, uma sessão de terapia ou uma chamada cujas cópias um regulador pode exigir, “o fornecedor diz que apaga” nem sempre é uma resposta aceitável.

Aqui, “IA de voz” significa um pipeline de fala em tempo real. Um agente de voz construído sobre ele tem quatro partes:

ParteO que fazPode rodar on-premise?
Fala em texto em streamingTranscreve enquanto a pessoa ainda falaSim
Detecção de turnosDecide quando a pessoa terminouSim
Modelo de linguagem + ferramentasDefine a resposta e chama seus sistemasSim, você escolhe
Texto em fala em streamingFala a resposta enquanto ela ainda é geradaSim

Todas elas podem rodar dentro do seu perímetro. O modelo de linguagem sempre foi sua escolha; o que os fornecedores costumam manter sob seu controle são os modelos de fala. A possibilidade de trazê-los para dentro da sua infraestrutura é um diferencial real entre fornecedores.

Por que empresas implantam IA de voz on-premise

Três motivos aparecem com frequência:

Soberania e residência de dados. Alguns contratos e jurisdições exigem que determinados dados nunca saiam de um limite físico ou jurídico que você controla. Uma API em nuvem transmite áudio a quem a opera; o on-premise mantém esse limite no seu rack.

Conformidade. Compradores de setores regulados relacionam implantações a estruturas como HIPAA, GDPR e PCI. Implantação local não garante conformidade por si só, mas torna a auditoria viável: o caminho dos dados começa e termina em infraestrutura que você pode mostrar a um auditor.

Latência e controle. Quando os modelos rodam na sua rede, você elimina uma viagem de ida e volta pela rede até o fornecedor e não herda os limites de taxa de ninguém. Para um agente de voz, o tempo de resposta é o produto; as pessoas passam a vez umas às outras em cerca de 200 milissegundos (Stivers et al., 2009), e um segundo de silêncio parece hesitação. Isso também explica a existência do extremo desse espectro, executar modelos no dispositivo: sem rede e sem infraestrutura compartilhada.

O espectro de implantação

“Nuvem ou on-premise” é, na prática, um espectro de quem opera o quê. A maioria das implantações empresariais adota uma destas opções:

ImplantaçãoOnde os modelos rodamQuem os operaCaminho dos dados
API em nuvemNuvem do fornecedorFornecedorO áudio sai da sua rede
VPC, nuvem privadaSua conta de nuvem, sua regiãoVocê, com suporte do fornecedorO áudio fica na sua conta de nuvem
Implantação localSeu data centerVocêO áudio fica na sua rede
Implantação local isoladoSeu data center, sem rota para a internetVocêNada sai, por construção
No dispositivoO próprio dispositivo finalVocêNada sai do hardware

Duas observações poupam tempo dos compradores. Primeiro, VPC não é on-premise: o hardware é seu, o data center não. Geralmente basta quando a restrição é contratual. Segundo, pergunte a cada fornecedor o que “on-premise” inclui. Alguns se referem a um contêiner que você executa, mas que ainda contata o fornecedor para licenciamento ou atualizações. Isso é on-premise conectado e não atende a requisitos de isolamento total.

Como avaliar um fornecedor de IA de voz on-premise

Estas perguntas separam ofertas on-premise reais de promessas de marketing:

  1. O isolamento é real? A inferência pode rodar sem nenhuma conectividade de saída ou algo, como licenciamento, telemetria ou uma chamada obrigatória à nuvem, sai da rede no meio da conversa?
  2. Os modelos on-premise são iguais aos modelos em nuvem? Alguns fornecedores entregam um modelo diferente e mais antigo que o da API. Se as demonstrações que você gostou usaram o modelo em nuvem, pergunte qual binário está comprando.
  3. Qual latência você obtém no seu ambiente? Os números do fornecedor são medidos no hardware dele. Peça um benchmark no seu hardware, com sua concorrência, no percentil 99, não na mediana.
  4. Quem atualiza os modelos e como? Implantação local não deve significar congelado. Pergunte como as atualizações são entregues, se é possível fixar versões e o efeito da troca de modelo nos prompts e vozes que você ajustou.
  5. Qual é a documentação de conformidade? SOC 2 Type II, um BAA que possa ser assinado, DPA publicado e condições de residência de dados. Se o fornecedor não consegue apresentar isso, o modelo de implantação não salvará o negócio.
  6. O pipeline inteiro vem para dentro? Um modelo TTS on-premise ao lado de um STT que não pode rodar assim deixa uma lacuna na implantação. Pergunte sobre o pipeline de ponta a ponta, incluindo a detecção de turnos.

Como a Cartesia faz on-premise

Os modelos da Cartesia usam modelos de espaço de estados, uma arquitetura projetada para inferência em tempo real. Os mesmos modelos estão disponíveis em nuvem, on-premise e no dispositivo. Na prática:

  • Sonic, nosso modelo de texto em fala, com latência de modelo inferior a 90ms, primeiro lugar em testes cegos de escuta de terceiros e 44 idiomas, pode ser implantado on-premise no seu data center, inclusive em ambientes isolados, na sua própria VPC na AWS, GCP ou Azure, ou via licenciamento OEM para integração direta ao seu produto.
  • Ink, nosso modelo de fala em texto em streaming com detecção nativa de turnos, tem as mesmas opções de implantação.
  • Para os AI Voice Agents da ServiceNow, a Cartesia fornece os modelos de voz, o mecanismo de inferência e a orquestração como uma implantação on-premise totalmente isolada, junto à conformidade com SOC 2 Type II, HIPAA, GDPR e PCI.
  • A Rasa inclui as opções de implantação on-premise da Cartesia em sua oferta empresarial, e a Blue Machines desenvolveu conosco uma arquitetura de implantação para ambientes regulados.
  • No extremo do espectro, Edge é nossa biblioteca de código aberto, Apache 2.0, para executar modelos de espaço de estados no dispositivo.

Implantações on-premise e OEM estão disponíveis em contratos empresariais; fale conosco sobre seus requisitos ou comece na nuvem com preços de autoatendimento e migre depois para dentro da sua infraestrutura. Como os modelos são os mesmos, a mudança é de implantação, não uma reconstrução.

Perguntas frequentes

O que é IA de voz on-premise?

IA de voz on-premise é um software de fala executado em hardware controlado pela sua organização, dentro da sua própria rede. Reconhecimento de fala, conversão de texto em fala e os modelos que decidem o que dizer rodam no seu data center ou nuvem privada, de modo que o áudio das chamadas e as transcrições nunca passam pelos servidores de um fornecedor.

Implantação local é o mesmo que air-gapped?

Não. Implantação local significa que o software roda no seu hardware. Air-gapped significa que ele roda sem nenhuma rota para a internet pública. Implantação local é o local da implantação; air-gapped é a política de rede mais restrita que você pode aplicar a ela. Organizações com requisitos de soberania geralmente querem dizer air-gapped quando pedem on-premise.

A conversão de texto em fala pode rodar on-premise?

Sim. Sonic, o modelo de texto em fala da Cartesia, pode ser implantado on-premise no seu data center, inclusive em ambientes isolados, ou na sua própria VPC na AWS, GCP ou Azure. O mesmo vale para Ink, o modelo de fala em texto em streaming da Cartesia. Ambos estão disponíveis em contratos empresariais.

Quais certificações de conformidade importam para IA de voz?

Procure SOC 2 Type II, elegibilidade à HIPAA com um BAA assinado e conformidade com o GDPR, e pergunte como o fornecedor trata a retenção de dados. A Cartesia tem certificação SOC 2 Type II, é elegível à HIPAA com BAAs disponíveis, está em conformidade com o GDPR e oferece retenção zero de dados nos serviços elegíveis. Seu Adendo de Proteção de Dados está publicado em cartesia.ai/legal/dpa.

Preciso de uma implantação totalmente on-premise para manter privado o áudio das chamadas?

Nem sempre. Se a restrição for contratual, e não física, uma implantação em VPC ou retenção zero de dados pode atendê-la com menos trabalho operacional. O custo do on-premise se justifica quando o áudio fisicamente não pode sair do seu perímetro ou quando um regulador ou contrato exige isso.