Acho o benchmark de STT em streaming da Coval útil porque traz a stack de inferência de volta à discussão, onde os produtos conversacionais realmente operam. Comparar apenas pesos ignora a latência mais sentida pelo usuário, que depende do caminho de implantação, da região e do endpoint por trás do modelo.
O que o benchmark de STT em streaming da Coval mede
Na verificação de 14 de setembro de 2026, a página de WER da Coval listava 30 modelos STT e 28 TTS em uma janela móvel de 30 dias. A tabela STT informa WER, latência de transcrição e número de amostras. Algumas entradas têm dezenas de milhares de amostras, outras muito menos. Isso importa na interpretação do ranking. Ranking WER da Coval
A página também oferece várias visões de latência, incluindo tempo até o segmento final, até o primeiro token e até a transcrição final. Produtos diferentes precisam de marcos diferentes. Uma ferramenta de legendas ao vivo se interessa pela velocidade da transcrição final. Um agente precisa saber quando pode voltar a falar com segurança. Visão geral dos benchmarks da Coval Ranking WER da Coval
A Coval executa o benchmark público de uma região fixa. Isso torna a comparação mais uniforme, pois todos os modelos recebem chamadas do mesmo lugar. Mas o resultado não é a latência que seus usuários terão em suas cidades e redes. Visão geral dos benchmarks da Coval
Essa configuração importa porque o ranking mede a etapa de inferência de ponta a ponta. Se o modelo usa um endpoint compartilhado ou uma implantação distante, os números incluem esse custo. O benchmark avalia o caminho do áudio até o modelo e de volta, além dos pesos. Ranking WER da Coval Visão geral dos benchmarks da Coval
Retrato da Baseten no ranking STT da Coval
Na tabela consultada em 14 de setembro, o endpoint Qwen3 ASR 1.7b da Baseten registra TTFS de 39ms e WER de 3.9% em 1,192 amostras. São medições desse endpoint nas condições da Coval. Ranking WER da Coval
A publicação da Baseten diz que a implantação é cerca de 5x mais rápida que a da OpenAI. As linhas brutas da Coval são mais precisas que essa manchete e mostram que a razão depende do endpoint OpenAI usado na comparação, já que eles não têm o mesmo TTFS. Publicação da Baseten sobre o benchmark Ranking WER da Coval
O texto da Baseten de 9 de setembro descreve o resultado de acesso antecipado como cerca de cinco vezes mais rápido que o da OpenAI. Trate isso como uma afirmação datada do fornecedor, com uma referência específica. Antes de usar essa razão em uma compra, confira modelo, endpoint, data e definição de latência dos dois lados. Publicação da Baseten sobre o benchmark Ranking WER da Coval
Como inferência dedicada e implantação criam essas diferenças
A Coval identifica algumas entradas como inferência dedicada e outras como compartilhada. Muitos gráficos de modelos omitem essa diferença, que pode mover uma implantação para a esquerda no gráfico de Pareto sem mudar nenhum peso. Ranking WER da Coval
A Baseten atribui seu resultado à inferência dedicada e ao ajuste do escalonamento automático. Isso combina com o comportamento de sistemas reais. Capacidade reservada reduz a interferência de outros clientes, e uma localização melhor diminui o tempo de rede antes de o modelo começar. Publicação da Baseten sobre o benchmark
Um endpoint compartilhado pode parecer bom em uma demonstração e pior em produção. Sob carga, a consistência importa tanto quanto a mediana. Se o p95 piora ou a faixa p25-p75 aumenta, o usuário sente hesitação, não apenas um número mais lento no ranking. Publicação da Baseten sobre o benchmark Ranking WER da Coval
Por isso, a proximidade importa. Colocar a inferência perto do usuário reduz a ida e volta pela rede. Em produtos conversacionais, isso é perceptível mesmo sem alterar o modelo. Visão geral dos benchmarks da Coval
O que o benchmark controla e onde pode induzir decisões erradas
Região e executor fixos removem uma fonte de ruído e tornam o teste mais reproduzível. Mas também facilitam confundir uma comparação justa com a realidade do produto, que é outra coisa. Visão geral dos benchmarks da Coval
O número de amostras importa pelo mesmo motivo. A Coval o mostra em cada entrada. Isso revela quando uma estimativa tem dezenas de milhares de enunciados por trás e quando não tem. Ranking WER da Coval
É por isso que comparações que ignoram a camada de inferência podem enganar. Um modelo fácil de hospedar no laboratório pode se tornar caro ou inconsistente ao acrescentar orquestração, escalonamento e rede entre usuário e servidor. Publicação da Baseten sobre o benchmark Visão geral dos benchmarks da Coval
A metodologia também muda a comparação entre rankings. TTFS, TTFT e tempo até a transcrição final não são intercambiáveis. Tratá-los como iguais significa comparar números que respondem a perguntas diferentes. Ranking WER da Coval
Como criar um pipeline STT de baixa latência e baixo WER com Ink-2
Para fazer um agente responder mais rápido, comece por um STT criado para alternar turnos, além de transcrever. O Ink-2 da Cartesia oferece detecção configurável e prompting com termos-chave. Você pode ajustar quando ele decide que o usuário terminou e informar nomes e jargões esperados. Documentação do Ink-2 da Cartesia
A detecção de fim de turno faz parte da rapidez de resposta. Se o modelo demora a confirmar o turno, o restante da stack fica ocioso. Se encerra cedo demais, interrompe o usuário. O controle relevante é um detector de turnos ajustável, não simplesmente um modelo maior. Documentação do Ink-2 da Cartesia LiveKit Agents
O mesmo modelo pode ter resultados diferentes conforme a implantação. As linhas da Coval mostram isso ao separar inferência dedicada e compartilhada. A Baseten descreve o mesmo padrão do lado do fornecedor. Decisões de implantação mudam a latência sem exigir outros pesos. Entrada do Ink-2 na Coval Publicação da Baseten sobre o benchmark
Se a exatidão final importa mais que as primeiras parciais, priorize a finalização semântica. Se o produto precisa falar antes, parciais rápidas podem vencer, mas isso troca explicitamente um pouco de risco de transcrição por uma pausa menor. AA-WER Streaming da Artificial Analysis
O relatório da Artificial Analysis de 1º de junho de 2026 mediu Ink-2 com finais semânticos em WER de 3.59% e 0.21 segundo até a primeira transcrição final após detectar o fim da fala. Dados, configurações e definições de tempo diferentes podem produzir resultados diferentes para o mesmo modelo. AA-WER Streaming da Artificial Analysis Entrada do Ink-2 na Coval
Prompting com termos-chave é outro ajuste útil antes de trocar de modelo. Se a transcrição erra nomes de produtos ou jargão interno, informar o vocabulário esperado costuma ser mais barato e específico que trocar de fornecedor. Documentação do Ink-2 da Cartesia
O suporte do framework também importa no ajuste de produção. O LiveKit Agents expõe pontos de configuração dos fornecedores, onde devem ficar os ajustes de turnos e termos-chave. O objetivo é integrar o modelo ao caminho real das chamadas. LiveKit Agents
Compromissos práticos entre velocidade e exatidão
Nos resultados da Artificial Analysis de 1º de junho de 2026, Deepgram Flux teve WER de 7.36% e 0.020 segundo até a primeira transcrição final após o fim da fala. Ink-2 com finais semânticos teve 3.59% e 0.21 segundo. Flux entregou a transcrição antes. Ink-2 cometeu menos erros nesse teste. Os resultados descrevem as configurações e os dados avaliados. AA-WER Streaming da Artificial Analysis
É assim que devemos interpretar um benchmark de STT em streaming. Ele não define o melhor modelo em abstrato. Vencer em velocidade não impede perder em erros relevantes, como encaminhar uma chamada incorretamente ou não reconhecer um produto. Ranking WER da Coval AA-WER Streaming da Artificial Analysis
A latência de cauda transforma um sistema geralmente bom em um sistema irritante. Mediana baixa com p95 ou p99 altos significa que usuários às vezes enfrentam pausas que fazem o agente parecer incerto, mesmo com média boa. Ranking WER da Coval
Teste separadamente localização da implantação, capacidade do endpoint, detecção de turnos e termos-chave. Registre o efeito de cada alteração nos erros e na latência antes de combiná-las. Assim, você sabe o que melhora a aplicação. Publicação da Baseten sobre o benchmark Documentação do Ink-2 da Cartesia
O que medir na própria stack antes de escolher
O número relevante é o medido no seu caminho. Em STT, meça da detecção de fim da fala à chegada do segmento final, nas condições reais de telefonia ou WebRTC, sem contornar a rede em um laboratório limpo. Visão geral dos benchmarks da Coval
Acompanhe percentis, além da mediana. Se o p50 é ótimo, mas p95 e p99 se afastam, o usuário ouve um sistema às vezes rápido e às vezes desconfortável. Isso costuma ser pior que uma resposta um pouco mais lenta, mas consistente. Ranking WER da Coval
Reproduza áudio representativo da produção, incluindo sotaques, ruído e vocabulário especializado. Mantenha um conjunto separado de avaliação para que os ajustes não otimizem apenas as gravações usadas no desenvolvimento.
Use o ranking público para selecionar opções, não como resposta final. Execute os candidatos na sua região, com sua concorrência e stack, antes de decidir o que seus usuários ouvirão. Visão geral dos benchmarks da Coval Publicação da Baseten sobre o benchmark
Comece com poucos endpoints e um corpus fixo. Registre erros de transcrição, demora de finalização e latência do fim da fala ao primeiro áudio sob concorrência esperada. Escolha a configuração que atenda aos objetivos de erro e resposta e repita o teste quando o modelo ou a implantação mudar.