Aprenda

O que o benchmark de STT em streaming da Coval revela sobre latência de inferência

Rene 
O que o benchmark de STT em streaming da Coval revela sobre latência de inferência

Acho o benchmark de STT em streaming da Coval útil porque traz a stack de inferência de volta à discussão, onde os produtos conversacionais realmente operam. Comparar apenas pesos ignora a latência mais sentida pelo usuário, que depende do caminho de implantação, da região e do endpoint por trás do modelo.

O que o benchmark de STT em streaming da Coval mede

Na verificação de 14 de setembro de 2026, a página de WER da Coval listava 30 modelos STT e 28 TTS em uma janela móvel de 30 dias. A tabela STT informa WER, latência de transcrição e número de amostras. Algumas entradas têm dezenas de milhares de amostras, outras muito menos. Isso importa na interpretação do ranking. Ranking WER da Coval

A página também oferece várias visões de latência, incluindo tempo até o segmento final, até o primeiro token e até a transcrição final. Produtos diferentes precisam de marcos diferentes. Uma ferramenta de legendas ao vivo se interessa pela velocidade da transcrição final. Um agente precisa saber quando pode voltar a falar com segurança. Visão geral dos benchmarks da Coval Ranking WER da Coval

A Coval executa o benchmark público de uma região fixa. Isso torna a comparação mais uniforme, pois todos os modelos recebem chamadas do mesmo lugar. Mas o resultado não é a latência que seus usuários terão em suas cidades e redes. Visão geral dos benchmarks da Coval

Essa configuração importa porque o ranking mede a etapa de inferência de ponta a ponta. Se o modelo usa um endpoint compartilhado ou uma implantação distante, os números incluem esse custo. O benchmark avalia o caminho do áudio até o modelo e de volta, além dos pesos. Ranking WER da Coval Visão geral dos benchmarks da Coval

Retrato da Baseten no ranking STT da Coval

Na tabela consultada em 14 de setembro, o endpoint Qwen3 ASR 1.7b da Baseten registra TTFS de 39ms e WER de 3.9% em 1,192 amostras. São medições desse endpoint nas condições da Coval. Ranking WER da Coval

A publicação da Baseten diz que a implantação é cerca de 5x mais rápida que a da OpenAI. As linhas brutas da Coval são mais precisas que essa manchete e mostram que a razão depende do endpoint OpenAI usado na comparação, já que eles não têm o mesmo TTFS. Publicação da Baseten sobre o benchmark Ranking WER da Coval

O texto da Baseten de 9 de setembro descreve o resultado de acesso antecipado como cerca de cinco vezes mais rápido que o da OpenAI. Trate isso como uma afirmação datada do fornecedor, com uma referência específica. Antes de usar essa razão em uma compra, confira modelo, endpoint, data e definição de latência dos dois lados. Publicação da Baseten sobre o benchmark Ranking WER da Coval

Como inferência dedicada e implantação criam essas diferenças

A Coval identifica algumas entradas como inferência dedicada e outras como compartilhada. Muitos gráficos de modelos omitem essa diferença, que pode mover uma implantação para a esquerda no gráfico de Pareto sem mudar nenhum peso. Ranking WER da Coval

A Baseten atribui seu resultado à inferência dedicada e ao ajuste do escalonamento automático. Isso combina com o comportamento de sistemas reais. Capacidade reservada reduz a interferência de outros clientes, e uma localização melhor diminui o tempo de rede antes de o modelo começar. Publicação da Baseten sobre o benchmark

Um endpoint compartilhado pode parecer bom em uma demonstração e pior em produção. Sob carga, a consistência importa tanto quanto a mediana. Se o p95 piora ou a faixa p25-p75 aumenta, o usuário sente hesitação, não apenas um número mais lento no ranking. Publicação da Baseten sobre o benchmark Ranking WER da Coval

Por isso, a proximidade importa. Colocar a inferência perto do usuário reduz a ida e volta pela rede. Em produtos conversacionais, isso é perceptível mesmo sem alterar o modelo. Visão geral dos benchmarks da Coval

O que o benchmark controla e onde pode induzir decisões erradas

Região e executor fixos removem uma fonte de ruído e tornam o teste mais reproduzível. Mas também facilitam confundir uma comparação justa com a realidade do produto, que é outra coisa. Visão geral dos benchmarks da Coval

O número de amostras importa pelo mesmo motivo. A Coval o mostra em cada entrada. Isso revela quando uma estimativa tem dezenas de milhares de enunciados por trás e quando não tem. Ranking WER da Coval

É por isso que comparações que ignoram a camada de inferência podem enganar. Um modelo fácil de hospedar no laboratório pode se tornar caro ou inconsistente ao acrescentar orquestração, escalonamento e rede entre usuário e servidor. Publicação da Baseten sobre o benchmark Visão geral dos benchmarks da Coval

A metodologia também muda a comparação entre rankings. TTFS, TTFT e tempo até a transcrição final não são intercambiáveis. Tratá-los como iguais significa comparar números que respondem a perguntas diferentes. Ranking WER da Coval

Como criar um pipeline STT de baixa latência e baixo WER com Ink-2

Para fazer um agente responder mais rápido, comece por um STT criado para alternar turnos, além de transcrever. O Ink-2 da Cartesia oferece detecção configurável e prompting com termos-chave. Você pode ajustar quando ele decide que o usuário terminou e informar nomes e jargões esperados. Documentação do Ink-2 da Cartesia

A detecção de fim de turno faz parte da rapidez de resposta. Se o modelo demora a confirmar o turno, o restante da stack fica ocioso. Se encerra cedo demais, interrompe o usuário. O controle relevante é um detector de turnos ajustável, não simplesmente um modelo maior. Documentação do Ink-2 da Cartesia LiveKit Agents

O mesmo modelo pode ter resultados diferentes conforme a implantação. As linhas da Coval mostram isso ao separar inferência dedicada e compartilhada. A Baseten descreve o mesmo padrão do lado do fornecedor. Decisões de implantação mudam a latência sem exigir outros pesos. Entrada do Ink-2 na Coval Publicação da Baseten sobre o benchmark

Se a exatidão final importa mais que as primeiras parciais, priorize a finalização semântica. Se o produto precisa falar antes, parciais rápidas podem vencer, mas isso troca explicitamente um pouco de risco de transcrição por uma pausa menor. AA-WER Streaming da Artificial Analysis

O relatório da Artificial Analysis de 1º de junho de 2026 mediu Ink-2 com finais semânticos em WER de 3.59% e 0.21 segundo até a primeira transcrição final após detectar o fim da fala. Dados, configurações e definições de tempo diferentes podem produzir resultados diferentes para o mesmo modelo. AA-WER Streaming da Artificial Analysis Entrada do Ink-2 na Coval

Prompting com termos-chave é outro ajuste útil antes de trocar de modelo. Se a transcrição erra nomes de produtos ou jargão interno, informar o vocabulário esperado costuma ser mais barato e específico que trocar de fornecedor. Documentação do Ink-2 da Cartesia

O suporte do framework também importa no ajuste de produção. O LiveKit Agents expõe pontos de configuração dos fornecedores, onde devem ficar os ajustes de turnos e termos-chave. O objetivo é integrar o modelo ao caminho real das chamadas. LiveKit Agents

Compromissos práticos entre velocidade e exatidão

Nos resultados da Artificial Analysis de 1º de junho de 2026, Deepgram Flux teve WER de 7.36% e 0.020 segundo até a primeira transcrição final após o fim da fala. Ink-2 com finais semânticos teve 3.59% e 0.21 segundo. Flux entregou a transcrição antes. Ink-2 cometeu menos erros nesse teste. Os resultados descrevem as configurações e os dados avaliados. AA-WER Streaming da Artificial Analysis

É assim que devemos interpretar um benchmark de STT em streaming. Ele não define o melhor modelo em abstrato. Vencer em velocidade não impede perder em erros relevantes, como encaminhar uma chamada incorretamente ou não reconhecer um produto. Ranking WER da Coval AA-WER Streaming da Artificial Analysis

A latência de cauda transforma um sistema geralmente bom em um sistema irritante. Mediana baixa com p95 ou p99 altos significa que usuários às vezes enfrentam pausas que fazem o agente parecer incerto, mesmo com média boa. Ranking WER da Coval

Teste separadamente localização da implantação, capacidade do endpoint, detecção de turnos e termos-chave. Registre o efeito de cada alteração nos erros e na latência antes de combiná-las. Assim, você sabe o que melhora a aplicação. Publicação da Baseten sobre o benchmark Documentação do Ink-2 da Cartesia

O que medir na própria stack antes de escolher

O número relevante é o medido no seu caminho. Em STT, meça da detecção de fim da fala à chegada do segmento final, nas condições reais de telefonia ou WebRTC, sem contornar a rede em um laboratório limpo. Visão geral dos benchmarks da Coval

Acompanhe percentis, além da mediana. Se o p50 é ótimo, mas p95 e p99 se afastam, o usuário ouve um sistema às vezes rápido e às vezes desconfortável. Isso costuma ser pior que uma resposta um pouco mais lenta, mas consistente. Ranking WER da Coval

Reproduza áudio representativo da produção, incluindo sotaques, ruído e vocabulário especializado. Mantenha um conjunto separado de avaliação para que os ajustes não otimizem apenas as gravações usadas no desenvolvimento.

Use o ranking público para selecionar opções, não como resposta final. Execute os candidatos na sua região, com sua concorrência e stack, antes de decidir o que seus usuários ouvirão. Visão geral dos benchmarks da Coval Publicação da Baseten sobre o benchmark

Comece com poucos endpoints e um corpus fixo. Registre erros de transcrição, demora de finalização e latência do fim da fala ao primeiro áudio sob concorrência esperada. Escolha a configuração que atenda aos objetivos de erro e resposta e repita o teste quando o modelo ou a implantação mudar.

Perguntas frequentes

A liderança da Baseten na Coval significa que é o melhor STT para meus usuários?

Não automaticamente. A Coval mede WER e latência após a fala de uma região fixa, com dados e endpoints específicos. Os números mostram o resultado nessa configuração. A latência em produção depende da região, da concorrência, da orquestração e do uso de inferência compartilhada ou dedicada.

Por que alguns fornecedores mostram latência muito menor nesses rankings?

Benchmarks da camada de inferência revelam diferenças de implantação. Endpoints dedicados, hardware reservado, regiões próximas e ajuste do escalonamento automático reduzem a variação da latência. Modelos otimizados para velocidade ou executados em hardware dedicado envolvem escolhas de engenharia e custo diferentes das de endpoints compartilhados.

Qual métrica indica se um modelo parecerá rápido na conversa?

No agente completo, meça do fim da fala do usuário ao primeiro áudio de resposta reproduzível. Meça separadamente da solicitação TTS ao primeiro áudio. Em STT, registre do fim da fala à primeira transcrição parcial utilizável e à final. Acompanhe p50, p95 e p99 com a concorrência e a rede esperadas.