Você está comparando modelos de fala para texto porque algo falhou mais adiante: um agente reservou o dia errado, uma transcrição distorceu um número de telefone ou uma tarefa em lote custou mais que o produto que ela sustenta. Esta página organiza os modelos relevantes em 2026 pela tarefa que você precisa executar e aponta as limitações de cada um.
Para transcrever áudio ao vivo em inglês para um agente de voz, o Ink 2 é o melhor ponto de partida. Ele ficou em primeiro lugar no ranking de fala para texto em streaming da Artificial Analysis em taxa de erro de palavras em junho de 2026 e detecta turnos sem um modelo separado. Para streaming multilíngue hoje, o Deepgram Nova-3 e os modelos Universal da AssemblyAI cobrem mais idiomas. Para transcrever arquivos gravados em hardware sob seu controle, o Whisper large-v3 da OpenAI é a opção padrão de código aberto. Os rankings mudam; consulte os atuais em vez de confiar em uma única página, inclusive esta.
Streaming e lote são tarefas diferentes
A primeira divisão não é entre fornecedores, mas entre dois tipos de trabalho:
- A transcrição em streaming, em tempo real, retorna texto enquanto a pessoa ainda está falando. Agentes de voz, legendas ao vivo e roteamento de chamadas precisam dela. O modelo confirma palavras que ouviu apenas parcialmente, então é avaliado pela precisão, pela latência e pela capacidade de identificar quando a pessoa terminou um pensamento.
- A transcrição em lote recebe uma gravação completa e retorna uma transcrição. Pós-produção de podcasts, notas de reuniões e análises de conformidade entram aqui. A latência importa muito menos; a precisão e o custo por hora importam mais.
Um modelo feito para uma tarefa raramente se destaca na outra. O Whisper é o exemplo mais claro: ótima precisão em lote para um modelo aberto, sem streaming nativo. Escolher com base em um único ranking combinado ignora essa diferença. Por isso, as comparações abaixo são agrupadas por tarefa.
Como avaliar um modelo de fala para texto
Três critérios decidem a maioria das implementações em tempo real:
- Precisão, principalmente nas sequências importantes para seu produto. A taxa média de erro de palavras (WER) esconde os erros que causam prejuízo. Um modelo pode ter uma WER geral respeitável e ainda distorcer códigos de confirmação, endereços de e-mail ou omitir um número falado sem aviso. São exatamente as falhas que quebram o fluxo de reservas de um agente. Abordamos o problema em mais detalhe no nosso guia sobre taxa de erro de palavras. A WER é um diagnóstico, não um veredito, pois depende da transcrição de referência e não diz quais erros um ouvinte perdoa.
- Detecção de turnos. Em uma conversa, alguém precisa decidir quando o usuário parou de falar. Muitas arquiteturas acrescentam um detector de atividade de voz e um limite de silêncio; essa combinação erra durante as pausas, e cada modelo extra no pipeline adiciona latência. Modelos com previsão de fim de turno integrada eliminam esse complemento.
- Latência em condições reais. As páginas dos fornecedores citam tempos medianos com áudio limpo. Seu áudio tem sotaques, falas sobrepostas e ruído de fundo, e o p95 é o que as pessoas vivenciam nas chamadas. Meça o tempo até a transcrição final com gravações semelhantes ao seu tráfego.
O preço é o quarto critério, e a resposta honesta aqui é pouco emocionante: as tarifas por minuto diferem por alguns décimos de centavo, mudam com frequência e importam menos que escolher um modelo que entenda seus clientes. Consulte as páginas de preços atualizadas quando ler isto.
Os modelos que vale comparar
Estes são os modelos que quem está selecionando soluções de fala para texto em 2026 encontrará. As afirmações vêm dos materiais de cada fornecedor ou de rankings independentes, com essa distinção indicada.
Cartesia Ink 2 para inglês em streaming em agentes de voz
O Ink 2 é um modelo de streaming criado para agentes em tempo real, desenvolvido por nós. Seus pontos fortes, segundo o artigo de lançamento e o ranking de streaming da Artificial Analysis, no qual ficou em primeiro lugar em taxa de erro de palavras em junho de 2026:
- Precisão em áudio de produção, incluindo gravações de linhas telefônicas, fala com sotaque, ambientes ruidosos e conferências de resultados financeiros. Nesses testes, superou Deepgram Flux, Soniox RT-V4, os modelos em tempo real da AssemblyAI e ElevenLabs Scribe-2-realtime. Ele lida com entidades estruturadas, como telefones, e-mails, UUIDs e datas, esperando a sequência completa antes de confirmá-la.
- Detecção de turnos integrada. A previsão de fim de turno faz parte do modelo, então você não precisa executar Silero nem um serviço separado de alternância de turnos. Em um pipeline Pipecat, as previsões antecipadas de fim de turno do Ink reduziram o tempo de resposta em cerca de meio segundo ao permitir que o agente começasse a responder antes do fim formal do turno do usuário.
- Resistência a ruído sem filtro de pré-processamento, eliminando uma etapa como o Krisp e seu custo e latência.
As limitações são claras: hoje o Ink 2 transcreve apenas inglês, com um modelo multilíngue em prévia. Se seus agentes atendem chamadas em espanhol ou hindi hoje, escolha uma das opções multilíngues abaixo e reavalie depois. A Cartesia oferece implantação na nuvem, local e em ambientes isolados da rede, e você pode testar o Ink gratuitamente no playground.
OpenAI Whisper large-v3 como opção padrão de código aberto para lote
O Whisper é a referência a superar para transcrição em lote nas suas próprias GPUs: pesos abertos, cerca de 99 idiomas, boa precisão em áudio limpo e sem dependência de um fornecedor. As equipes o hospedam por conta própria para cargas sensíveis à privacidade ou ao custo.
Sua limitação aparece justamente na tarefa do título desta página. O Whisper funciona apenas em lote: não tem streaming nativo nem detecção de turnos e tem um comportamento conhecido de inventar frases durante silêncio ou áudio sem fala. É a falha que o artigo da AssemblyAI aponta como ressalva, herdada por toda camada de streaming construída sobre o Whisper. Configurações de streaming por blocos acrescentam cerca de 500 milissegundos de latência e precisam resolver a detecção do fim da fala por conta própria. Use o Whisper para arquivos. Não o use como o ouvido de um agente em tempo real.
Deepgram Nova-3 para streaming multilíngue em escala
O Nova-3 da Deepgram é uma API de streaming consolidada para implementações multilíngues: latência de streaming inferior a 300 milissegundos, segundo o fornecedor, alternância entre dez idiomas em tempo real e personalização por domínio. O artigo de lançamento do Nova-3 relata WER mediana de 6.84% em áudio em streaming. É um número do fornecedor; índices independentes indicam valores maiores, um lembrete para tratar esses números como marketing até reproduzi-los. A Deepgram também oferece o Flux, modelo que acrescenta detecção de fim de turno para agentes de voz, reconhecendo que STT convencional sozinho não resolve a alternância de turnos.
Escolha o Nova-3 quando precisar de muitos idiomas em produção hoje e puder aceitar uma camada separada de detecção de turnos ou o Flux junto dele.
AssemblyAI Universal com streaming e inteligência de fala integrados
A linha Universal da AssemblyAI combina transcrição em streaming com resumo, detecção de entidades, análise de sentimento e remoção de informações pessoais em uma API. Seus modelos em tempo real competem diretamente em benchmarks de agentes de voz. Os próprios artigos da empresa relatam WER de 5.19% para o Universal-3.6 Pro Realtime no seu benchmark de agentes de voz em inglês, à frente de Scribe v2 e Nova-3 no mesmo teste. Trate isso como um benchmark conduzido pelo fornecedor. A proposta é clara: um fornecedor para transcrição e inteligência de áudio. É uma boa escolha quando a transcrição alimenta análises além de um agente.
Google Chirp 3 para equipes que já usam Google Cloud
O Chirp 3 do Google completa as opções gerenciadas, com ampla cobertura de idiomas e a simplicidade operacional de permanecer em um provedor de nuvem que muitas equipes já utilizam. Raramente lidera rankings independentes de precisão para inglês em streaming, mas a realidade das compras, com contratos existentes, requisitos de conformidade e uma única fatura, mantém seu uso em produção.
Ink ou Whisper, quando a opção padrão de código aberto perde
A comparação mais comum que vemos é entre Cartesia Ink e OpenAI Whisper, por isso ela merece uma resposta própria. A pergunta parece ser “qual modelo é melhor”, mas a pergunta real é “qual tarefa você precisa executar”.
O Whisper vence quando você tem arquivos, muitos idiomas e suas próprias GPUs: transcrições em lote de chamadas gravadas, podcasts ou arquivos históricos, com baixo custo em escala e sem uma conta por minuto de um fornecedor.
O Ink vence quando você tem uma conversa ao vivo: ele faz streaming enquanto o usuário fala, confirma palavras mais rápido, prevê o fim do turno sem um modelo separado e mantém a precisão em números, identificadores e sotaques. Esses erros podem virar reservas incorretas. Executar Whisper com uma camada de streaming significa assumir a divisão em blocos, a detecção do fim da fala e as alucinações durante o silêncio, pagando por isso em latência de ida e volta.
Um critério útil de desempate: se seu pipeline já inclui Silero, Krisp e uma máquina de estados com limite de silêncio sustentada por novas tentativas, essa estrutura existe para compensar o uso de um modelo em lote em uma tarefa de streaming. Um modelo nativo de streaming a substitui.
Qual modelo de fala para texto escolher?
Combine o modelo com a tarefa:
| Sua tarefa | Comece com |
|---|---|
| Agente de voz ao vivo em inglês | Ink 2 |
| Transcrição multilíngue ao vivo | Deepgram Nova-3, AssemblyAI Universal em tempo real |
| Arquivos em lote, com hospedagem própria | Whisper large-v3 |
| Transcrição e análises em uma API | AssemblyAI Universal |
| Permanecer em um contrato de nuvem existente | Google Chirp 3 |
Antes de decidir, teste com seu próprio áudio. Todos os números desta página vieram de gravações de outras pessoas; o ranking que importa é aquele produzido pelo seu tráfego. Passe algumas das suas chamadas mais difíceis, com sotaques, falas sobrepostas ou alguém soletrando um código de confirmação, pelos dois ou três finalistas. Compare os resultados, inclusive os erros que seu produto não pode aceitar.
Se a tarefa é criar agentes de voz em inglês, teste o Ink 2 no playground sem configuração ou leia como criar um agente de voz para entender onde a transcrição entra no pipeline completo.
Documentação relacionada
- Artigo de lançamento do Ink 2, com os resultados de precisão, detecção de turnos e latência que sustentam a posição no ranking
- Taxa de erro de palavras explicada, por que a WER é um diagnóstico, não um veredito
- Detecção de atividade de voz para agentes de voz, por que limites baseados em silêncio falham
- Crie um agente de voz com Pipecat e Cartesia, um pipeline de streaming funcional com as previsões antecipadas de fim de turno do Ink
- Ranking de fala para texto em streaming da Artificial Analysis, com as posições atuais dos fornecedores