Histórias de clientes

Benchmark de IA de voz da Speko recomenda o Sonic 3.5 com mais frequência

A Speko é um roteador de IA de voz. Desenvolvedores criam e executam agentes de voz por uma única API da Speko, que escolhe os modelos de fala para texto, LLM e texto para fala para cada chamada com base no idioma e na aplicação. Essas escolhas vêm de um benchmark que a Speko repete a cada dois ou três dias com cerca de uma dúzia de provedores. Em texto para fala, o modelo que fica em primeiro lugar com mais frequência é o Sonic 3.5 da Cartesia.

Estamos basicamente construindo um roteador aberto de IA de voz. Queremos ser essa camada neutra que ajuda as pessoas a escolher a combinação certa de modelos.

Beknazar AbdikamalovFundador, Speko

O desafio: três decisões sobre modelos e ninguém neutro a quem perguntar

Cerca de 95% da IA de voz funciona em cascata: fala para texto, depois um LLM e, por fim, texto para fala. São três decisões distintas sobre modelos para cada agente, e a maioria dos provedores que opina sobre elas tem interesse na resposta. Novos provedores continuam chegando, então há mais opções a cada mês sem mais clareza sobre quais funcionam bem.

Fora do inglês, a escolha fica mais difícil. Um modelo que lê bem em inglês pode variar ou perder expressividade em outro idioma, e há pouquíssimos dados públicos sobre quais fazem isso. Empresas grandes o bastante para conduzir suas próprias avaliações já sabem quais combinações funcionam em cada situação. Todas as outras escolhem com base em páginas de marketing.

A solução: um benchmark atualizado a cada dois ou três dias

A Speko avalia em etapas, de modo que um novo modelo passa por verificações automatizadas de baixo custo antes que alguém invista muito nele. Agentes monitoram o X e o Hugging Face em busca de lançamentos promissores, e tudo o que encontram passa primeiro por essas verificações. Modelos com bons resultados avançam para avaliação humana e testes com orçamento maior. Cerca de uma dúzia de provedores é acompanhada a qualquer momento.

Repetir o benchmark a cada dois ou três dias mantém os números vinculados às versões atuais dos modelos, em vez das versões lançadas no trimestre anterior. Cada categoria tem seus próprios critérios. Texto para fala tem três:

  • Inteligibilidade: o modelo lê o texto de maneira sensata, considerando o contexto e com qualidade utilizável em produção, além de acertar as palavras?
  • Variação: a voz permanece consistente ao longo da geração ou a qualidade, o tom e o ritmo oscilam?
  • Naturalidade: a voz soa humana ou apresenta características robóticas que prejudicam a experiência?

Avaliar os três separadamente permite fazer recomendações específicas para cada aplicação. Abdikamalov divide a maioria dos clientes em dois grupos. Agentes de atendimento se preocupam com latência e medem o sucesso pela resolução rápida e precisa. Instrutores de IA e produtos de terapia precisam de vozes que pareçam humanas. A maioria dos provedores é boa em um ou outro aspecto.

Por que a Speko escolheu a Cartesia

O Sonic 3.5 lidera a classificação geral de texto para fala da Speko com a melhor combinação de velocidade e naturalidade, mantendo um preço competitivo em relação aos outros modelos acompanhados. Esses dois eixos abrangem a maior parte do que os clientes da Speko criam: latência para atendimento e naturalidade para orientação e terapia. Ter bom desempenho nos dois é raro, por isso o Sonic 3.5 é a recomendação de texto para fala mais frequente da Speko.

Padrão, aqui, significa recomendado com mais frequência, não selecionado automaticamente. Quando os requisitos de um cliente apontam para outro modelo, a Speko direciona a chamada para ele. A recomendação segue a aplicação; o Sonic vence em muitas delas nos critérios que importam.

O próximo passo: tornar a escolha de modelos invisível

A Speko trabalha em duas frentes ao mesmo tempo. A primeira é tornar a escolha de modelos algo em que os clientes nunca precisem pensar. Abdikamalov não quer que a combinação certa dependa de quanto o cliente entende dos modelos que a compõem.

Fazer com que as pessoas não precisem entender da seleção de modelos. Acho que, idealmente, elas nem deveriam precisar saber o que está por trás.

Beknazar AbdikamalovFundador, Speko

A segunda é se tornar o benchmark em que o setor confia. Muitas classificações ordenam modelos de voz sem publicar metodologia suficiente para verificar os resultados, e outras se baseiam em demonstrações limitadas que pouco dizem sobre o comportamento em produção. A Speko quer um benchmark que se atualize regularmente, publique como funciona e teste o que os clientes realmente constroem.

Abdikamalov estima que cerca de 1% das empresas usa IA de voz hoje. À medida que esse número crescer, a quantidade de modelos também aumentará, e a parte difícil continuará a mesma: saber em quais confiar e em que situações.