Aprenda

Comparação dos melhores modelos de fala para texto (2026)

Rene 
Comparação dos melhores modelos de fala para texto (2026)

Você está comparando modelos de fala para texto porque algo falhou mais adiante: um agente reservou o dia errado, uma transcrição distorceu um número de telefone ou uma tarefa em lote custou mais que o produto que ela sustenta. Esta página organiza os modelos relevantes em 2026 pela tarefa que você precisa executar e aponta as limitações de cada um.

Para transcrever áudio ao vivo em inglês para um agente de voz, o Ink 2 é o melhor ponto de partida. Ele ficou em primeiro lugar no ranking de fala para texto em streaming da Artificial Analysis em taxa de erro de palavras em junho de 2026 e detecta turnos sem um modelo separado. Para streaming multilíngue hoje, o Deepgram Nova-3 e os modelos Universal da AssemblyAI cobrem mais idiomas. Para transcrever arquivos gravados em hardware sob seu controle, o Whisper large-v3 da OpenAI é a opção padrão de código aberto. Os rankings mudam; consulte os atuais em vez de confiar em uma única página, inclusive esta.

Streaming e lote são tarefas diferentes

A primeira divisão não é entre fornecedores, mas entre dois tipos de trabalho:

  • A transcrição em streaming, em tempo real, retorna texto enquanto a pessoa ainda está falando. Agentes de voz, legendas ao vivo e roteamento de chamadas precisam dela. O modelo confirma palavras que ouviu apenas parcialmente, então é avaliado pela precisão, pela latência e pela capacidade de identificar quando a pessoa terminou um pensamento.
  • A transcrição em lote recebe uma gravação completa e retorna uma transcrição. Pós-produção de podcasts, notas de reuniões e análises de conformidade entram aqui. A latência importa muito menos; a precisão e o custo por hora importam mais.

Um modelo feito para uma tarefa raramente se destaca na outra. O Whisper é o exemplo mais claro: ótima precisão em lote para um modelo aberto, sem streaming nativo. Escolher com base em um único ranking combinado ignora essa diferença. Por isso, as comparações abaixo são agrupadas por tarefa.

Como avaliar um modelo de fala para texto

Três critérios decidem a maioria das implementações em tempo real:

  1. Precisão, principalmente nas sequências importantes para seu produto. A taxa média de erro de palavras (WER) esconde os erros que causam prejuízo. Um modelo pode ter uma WER geral respeitável e ainda distorcer códigos de confirmação, endereços de e-mail ou omitir um número falado sem aviso. São exatamente as falhas que quebram o fluxo de reservas de um agente. Abordamos o problema em mais detalhe no nosso guia sobre taxa de erro de palavras. A WER é um diagnóstico, não um veredito, pois depende da transcrição de referência e não diz quais erros um ouvinte perdoa.
  2. Detecção de turnos. Em uma conversa, alguém precisa decidir quando o usuário parou de falar. Muitas arquiteturas acrescentam um detector de atividade de voz e um limite de silêncio; essa combinação erra durante as pausas, e cada modelo extra no pipeline adiciona latência. Modelos com previsão de fim de turno integrada eliminam esse complemento.
  3. Latência em condições reais. As páginas dos fornecedores citam tempos medianos com áudio limpo. Seu áudio tem sotaques, falas sobrepostas e ruído de fundo, e o p95 é o que as pessoas vivenciam nas chamadas. Meça o tempo até a transcrição final com gravações semelhantes ao seu tráfego.

O preço é o quarto critério, e a resposta honesta aqui é pouco emocionante: as tarifas por minuto diferem por alguns décimos de centavo, mudam com frequência e importam menos que escolher um modelo que entenda seus clientes. Consulte as páginas de preços atualizadas quando ler isto.

Os modelos que vale comparar

Estes são os modelos que quem está selecionando soluções de fala para texto em 2026 encontrará. As afirmações vêm dos materiais de cada fornecedor ou de rankings independentes, com essa distinção indicada.

Cartesia Ink 2 para inglês em streaming em agentes de voz

O Ink 2 é um modelo de streaming criado para agentes em tempo real, desenvolvido por nós. Seus pontos fortes, segundo o artigo de lançamento e o ranking de streaming da Artificial Analysis, no qual ficou em primeiro lugar em taxa de erro de palavras em junho de 2026:

  • Precisão em áudio de produção, incluindo gravações de linhas telefônicas, fala com sotaque, ambientes ruidosos e conferências de resultados financeiros. Nesses testes, superou Deepgram Flux, Soniox RT-V4, os modelos em tempo real da AssemblyAI e ElevenLabs Scribe-2-realtime. Ele lida com entidades estruturadas, como telefones, e-mails, UUIDs e datas, esperando a sequência completa antes de confirmá-la.
  • Detecção de turnos integrada. A previsão de fim de turno faz parte do modelo, então você não precisa executar Silero nem um serviço separado de alternância de turnos. Em um pipeline Pipecat, as previsões antecipadas de fim de turno do Ink reduziram o tempo de resposta em cerca de meio segundo ao permitir que o agente começasse a responder antes do fim formal do turno do usuário.
  • Resistência a ruído sem filtro de pré-processamento, eliminando uma etapa como o Krisp e seu custo e latência.

As limitações são claras: hoje o Ink 2 transcreve apenas inglês, com um modelo multilíngue em prévia. Se seus agentes atendem chamadas em espanhol ou hindi hoje, escolha uma das opções multilíngues abaixo e reavalie depois. A Cartesia oferece implantação na nuvem, local e em ambientes isolados da rede, e você pode testar o Ink gratuitamente no playground.

OpenAI Whisper large-v3 como opção padrão de código aberto para lote

O Whisper é a referência a superar para transcrição em lote nas suas próprias GPUs: pesos abertos, cerca de 99 idiomas, boa precisão em áudio limpo e sem dependência de um fornecedor. As equipes o hospedam por conta própria para cargas sensíveis à privacidade ou ao custo.

Sua limitação aparece justamente na tarefa do título desta página. O Whisper funciona apenas em lote: não tem streaming nativo nem detecção de turnos e tem um comportamento conhecido de inventar frases durante silêncio ou áudio sem fala. É a falha que o artigo da AssemblyAI aponta como ressalva, herdada por toda camada de streaming construída sobre o Whisper. Configurações de streaming por blocos acrescentam cerca de 500 milissegundos de latência e precisam resolver a detecção do fim da fala por conta própria. Use o Whisper para arquivos. Não o use como o ouvido de um agente em tempo real.

Deepgram Nova-3 para streaming multilíngue em escala

O Nova-3 da Deepgram é uma API de streaming consolidada para implementações multilíngues: latência de streaming inferior a 300 milissegundos, segundo o fornecedor, alternância entre dez idiomas em tempo real e personalização por domínio. O artigo de lançamento do Nova-3 relata WER mediana de 6.84% em áudio em streaming. É um número do fornecedor; índices independentes indicam valores maiores, um lembrete para tratar esses números como marketing até reproduzi-los. A Deepgram também oferece o Flux, modelo que acrescenta detecção de fim de turno para agentes de voz, reconhecendo que STT convencional sozinho não resolve a alternância de turnos.

Escolha o Nova-3 quando precisar de muitos idiomas em produção hoje e puder aceitar uma camada separada de detecção de turnos ou o Flux junto dele.

AssemblyAI Universal com streaming e inteligência de fala integrados

A linha Universal da AssemblyAI combina transcrição em streaming com resumo, detecção de entidades, análise de sentimento e remoção de informações pessoais em uma API. Seus modelos em tempo real competem diretamente em benchmarks de agentes de voz. Os próprios artigos da empresa relatam WER de 5.19% para o Universal-3.6 Pro Realtime no seu benchmark de agentes de voz em inglês, à frente de Scribe v2 e Nova-3 no mesmo teste. Trate isso como um benchmark conduzido pelo fornecedor. A proposta é clara: um fornecedor para transcrição e inteligência de áudio. É uma boa escolha quando a transcrição alimenta análises além de um agente.

Google Chirp 3 para equipes que já usam Google Cloud

O Chirp 3 do Google completa as opções gerenciadas, com ampla cobertura de idiomas e a simplicidade operacional de permanecer em um provedor de nuvem que muitas equipes já utilizam. Raramente lidera rankings independentes de precisão para inglês em streaming, mas a realidade das compras, com contratos existentes, requisitos de conformidade e uma única fatura, mantém seu uso em produção.

Ink ou Whisper, quando a opção padrão de código aberto perde

A comparação mais comum que vemos é entre Cartesia Ink e OpenAI Whisper, por isso ela merece uma resposta própria. A pergunta parece ser “qual modelo é melhor”, mas a pergunta real é “qual tarefa você precisa executar”.

O Whisper vence quando você tem arquivos, muitos idiomas e suas próprias GPUs: transcrições em lote de chamadas gravadas, podcasts ou arquivos históricos, com baixo custo em escala e sem uma conta por minuto de um fornecedor.

O Ink vence quando você tem uma conversa ao vivo: ele faz streaming enquanto o usuário fala, confirma palavras mais rápido, prevê o fim do turno sem um modelo separado e mantém a precisão em números, identificadores e sotaques. Esses erros podem virar reservas incorretas. Executar Whisper com uma camada de streaming significa assumir a divisão em blocos, a detecção do fim da fala e as alucinações durante o silêncio, pagando por isso em latência de ida e volta.

Um critério útil de desempate: se seu pipeline já inclui Silero, Krisp e uma máquina de estados com limite de silêncio sustentada por novas tentativas, essa estrutura existe para compensar o uso de um modelo em lote em uma tarefa de streaming. Um modelo nativo de streaming a substitui.

Qual modelo de fala para texto escolher?

Combine o modelo com a tarefa:

Sua tarefaComece com
Agente de voz ao vivo em inglêsInk 2
Transcrição multilíngue ao vivoDeepgram Nova-3, AssemblyAI Universal em tempo real
Arquivos em lote, com hospedagem própriaWhisper large-v3
Transcrição e análises em uma APIAssemblyAI Universal
Permanecer em um contrato de nuvem existenteGoogle Chirp 3

Antes de decidir, teste com seu próprio áudio. Todos os números desta página vieram de gravações de outras pessoas; o ranking que importa é aquele produzido pelo seu tráfego. Passe algumas das suas chamadas mais difíceis, com sotaques, falas sobrepostas ou alguém soletrando um código de confirmação, pelos dois ou três finalistas. Compare os resultados, inclusive os erros que seu produto não pode aceitar.

Se a tarefa é criar agentes de voz em inglês, teste o Ink 2 no playground sem configuração ou leia como criar um agente de voz para entender onde a transcrição entra no pipeline completo.

Documentação relacionada

Perguntas frequentes

Qual é o melhor modelo de fala para texto?

Depende da tarefa. Para inglês em streaming em um agente de voz, o Ink 2 liderava o ranking de streaming da Artificial Analysis em taxa de erro de palavras em junho de 2026 e tem detecção de turnos integrada. Para streaming multilíngue, o Deepgram Nova-3 e os modelos Universal da AssemblyAI cobrem mais idiomas hoje. Para transcrição em lote no seu próprio hardware, o Whisper large-v3 é a opção padrão de código aberto. Consulte os rankings atuais em vez de confiar em uma única página, inclusive esta.

O Whisper consegue transcrever em tempo real?

Não de forma nativa. O Whisper é um modelo em lote: ele espera um segmento de áudio completo antes de retornar o texto. As equipes criam camadas de streaming dividindo o áudio em blocos e tratando por conta própria a detecção do fim da fala, o que acrescenta latência e pontos de falha. Se você precisa de transcrição ao vivo, um modelo nativo de streaming, como Cartesia Ink, Deepgram Nova-3 ou os modelos em tempo real da AssemblyAI, é o caminho mais simples.

O que é taxa de erro de palavras? Uma WER menor é sempre melhor?

A taxa de erro de palavras (WER) é a proporção de palavras que um modelo transcreve incorretamente em relação a uma transcrição de referência. É um diagnóstico útil, não um veredito completo: penaliza escolhas de formatação, depende do modelo ASR que avaliou a referência, e duas implementações com a mesma WER podem parecer muito diferentes se uma delas omitir números e identificadores. Avalie com seu próprio áudio e dê mais peso aos erros que sua aplicação não pode tolerar.

Qual modelo de fala para texto lida melhor com números e identificadores?

Procure avaliações por entidade, não apenas a WER média. Números de telefone, endereços de e-mail, sequências alfanuméricas e datas falham de formas diferentes das palavras comuns, e alguns modelos lidam melhor com entidades no meio de uma sequência. O Ink 2, por exemplo, espera a sequência completa antes de confirmá-la. Seja qual for sua escolha, teste com as sequências que seu produto realmente ouve: números de pedido, códigos de confirmação e endereços.

Quanto custa o Ink 2?

O Ink 2 é cobrado por minuto de áudio, com descontos por volume e preços personalizados em contratos empresariais. Os valores atuais estão na página de preços da Cartesia, e você pode testar o modelo gratuitamente no playground da Cartesia.