“IA de voz” se tornou um nome geral para quatro negócios diferentes, fornecedores de modelos de fala, plataformas que os combinam em agentes, serviços de nuvem e projetos de código aberto. Este guia mostra quem faz o quê no fim de 2026, para você selecionar as duas ou três opções adequadas à tarefa, em vez de testar uma dúzia.
Somos uma das empresas da lista e deixamos isso claro. Quando uma afirmação importa, apontamos um ranking ou uma página de produto que você pode conferir.
Fornecedores de modelos de fala
Essas empresas treinam os próprios modelos e os vendem por APIs. Se você está incorporando voz a um produto, é essa camada que contrata.
A Cartesia, nossa empresa, cria modelos em tempo real com arquitetura de modelos de espaço de estados, linha de pesquisa em que nossos fundadores foram pioneiros no Stanford AI Lab. O Sonic é nosso TTS. Ele transmite áudio durante a geração, com latência do modelo abaixo de 90ms, mais de 40 idiomas e primeiro lugar nos testes cegos do VoiceArena e da Artificial Analysis. O Ink é nosso STT em streaming com detecção integrada de turnos, e o Managed Agents permite criar agentes para produção. Decagon, ServiceNow, Quora, Retell e EliseAI usam a plataforma. Veja clientes e preços.
O ElevenLabs é a maior marca voltada ao consumidor nesse mercado, com biblioteca de vozes, clonagem, dublagem e estúdio para criadores. Sua página inicial agora também destaca agentes. Seu ponto forte é a produção criativa. Para agentes em tempo real, compare diretamente o tempo até o primeiro áudio. Nossa comparação com ElevenLabs detalha as diferenças.
A Deepgram vende APIs STT e TTS com foco empresarial. Sua reputação vem da transcrição rápida em escala. Avalie o TTS separadamente do STT.
O PlayHT oferece APIs TTS há anos. O site não carregou na verificação de 24 de setembro de 2026. Confirme operação e suporte antes de depender dele.
O Speechify é mais conhecido como assistente para ouvir documentos. A empresa declara mais de 60M usuários. Estúdio e API são produtos separados do aplicativo de leitura.
Murf AI e WellSaid Labs se concentram em locução. O Murf tem um editor de roteiro para voz e agora também anuncia agentes conversacionais. O WellSaid atende a fluxos empresariais de narração.
Plataformas de agentes de voz
Em geral, essas empresas não treinam modelos de fala. Elas orquestram reconhecimento, modelos de linguagem e síntese em agentes por telefone ou aplicativo. Você contrata a infraestrutura de telefonia, orquestração e observabilidade.
A Vapi é uma plataforma para desenvolvedores comporem agentes com componentes de diferentes fornecedores. A Retell AI cria agentes para produção e usa vozes da Cartesia em sua stack. A Bland AI se concentra em agentes que fazem e atendem chamadas em escala. A LiveKit fornece infraestrutura de áudio e vídeo em tempo real, a base WebRTC de muitos produtos de voz.
Se você quer um agente sem montar o pipeline, comece aqui. Se precisa controlar os modelos, contrate os fornecedores acima e faça sua própria integração.
Serviços de fala em nuvem
Google Cloud, com Speech-to-Text e Text-to-Speech, Microsoft Azure AI Speech e Amazon Polly são os serviços estabelecidos. Têm a maior distribuição, ferramentas amplas de conformidade e longo histórico. Qualidade de voz e latência conversacional são áreas em que startups os têm superado. Se sua organização já opera em uma dessas nuvens, são o caminho mais simples.
A OpenAI oferece fala por suas APIs, incluindo Realtime para sessões de fala para fala. Seus modelos também alimentam o modo de voz do ChatGPT.
Código aberto
A Fish Audio publica modelos de pesos abertos, Fish Speech, além de uma plataforma hospedada. Whisper continua sendo o modelo aberto de referência para STT. Projetos como Piper e F5-TTS atendem ao TTS com hospedagem própria. Código aberto oferece controle e armazenamento local dos dados, mas exige operar a infraestrutura. Latência e qualidade variam bastante conforme a configuração.
Como escolher
Primeiro associe o fornecedor à tarefa, depois ao ranking. Um agente em tempo real precisa de streaming e baixo tempo até o primeiro áudio. Teste com seu roteiro, sua rede e sua região de implantação. Narração gravada precisa mais de fluxo de edição e direitos comerciais que de 90 milissegundos.
Depois, teste de verdade, com os mesmos roteiros nos dois sistemas, incluindo números de conta, abreviações e respostas interrompidas. Nosso guia de agentes de voz cobre a avaliação dessas cargas, e a central de comparações traz análises lado a lado dos concorrentes citados.
Se quiser ouvir o TTS classificado em primeiro lugar antes de ler outra comparação, o gerador de voz executa Sonic no navegador, sem cadastro.