Histórias de clientes

Como a Cartesia dá voz aos avatares de IA mais responsivos do mundo

Sobre a empresa

A Cerebrium cria infraestrutura serverless para equipes de IA implantarem aplicações em minutos. A equipe se entusiasma com a IA em tempo real e as possibilidades que ela abre para simular interações humanas muito realistas.

A empresa apresentou algumas aplicações práticas de avatares de IA nesta demonstração criada para treinamento de vendas e entrevistas com usuários.

Veja a demonstração da Cerebrium:

Criando o avatar de IA mais responsivo do mundo

A Cerebrium tinha uma visão: um avatar de IA capaz de treinar vendedores e orientar candidatos a vagas com a capacidade de resposta de uma pessoa real.

Cada milissegundo de latência conta, porque as pessoas são impacientes e pausas longas denunciam que você está falando com uma IA. Por isso, ao montar a infraestrutura tecnológica desta demonstração, a Cerebrium buscou otimizar a latência sem perder a qualidade de uma conversa humana natural.

A Cerebrium combinou três tecnologias principais para criar sua demonstração inovadora:

  1. Mistral: modelo de linguagem de 7 bilhões de parâmetros
  2. Tavus: avatares de IA
  3. Cartesia: API de voz ultrarrealista com baixa latência

Com latência do modelo inferior a 100 ms até o primeiro áudio, a Cartesia é a solução de voz generativa mais rápida do mercado. Ela também oferece as vozes mais realistas e naturais, como confirmam diversas plataformas independentes de avaliação de modelos, como a Artificial Analysis, que realiza testes cegos de preferência humana entre todos os principais provedores de texto para fala.

A Cartesia também é o único provedor que oferece controles detalhados de criação de voz, como velocidade e emoção. Isso permite que os usuários desta demonstração pratiquem diferentes cenários de vendas e entrevistas em que a pessoa com quem conversam pode estar irritada, falar rápido demais e assim por diante.

Somos o único provedor capaz de equilibrar velocidade e qualidade porque construímos nossa API de voz sobre modelos de espaço de estados, ou SSMs, uma arquitetura fundamentalmente mais eficiente para modelos de IA.

O resultado são interações por voz indistinguíveis de uma conversa com um instrutor humano. O avatar pode:

  • Responder às entradas do usuário em menos de 500 ms de ponta a ponta
  • Ajustar o tom de cliente irritado a instrutor encorajador
  • Conduzir conversas complexas levando em conta o contexto

Experimente: https://coaching.cerebrium.ai/

Por que a latência importa

  1. Engajamento: respostas mais rápidas tornam as conversas mais naturais. Os usuários permanecem engajados por mais tempo.
  2. Escalabilidade: latência menor permite atender mais usuários simultâneos sem sacrificar a qualidade.
  3. Experiência do usuário: em um mundo de gratificação instantânea, até pequenos atrasos podem causar frustração e abandono.

Seja para criar um bot de atendimento, um assistente virtual ou a próxima grande novidade em tecnologia educacional, a velocidade é a chave para uma experiência realista.

Pronto para potencializar sua IA com as vozes da Cartesia?

A demonstração da Cerebrium é só o começo. Veja outros exemplos de aplicações que nossa comunidade já cria com nossas vozes:

Um aplicativo de aprendizado de idiomas que responde instantaneamente a erros de pronúncia

Um chatbot de saúde mental que identifica sinais emocionais em tempo real

Um parceiro de estudos que faz perguntas sobre o conteúdo de artigos científicos densos

Para conhecer os detalhes técnicos de como a Cerebrium construiu seu avatar, confira o artigo completo no blog da empresa.