No mês passado, lançamos o Ink-2, o modelo STT em streaming mais preciso para inglês.
Hoje lançamos dois novos recursos. O prompting com termos-chave melhora a exatidão da transcrição de entidades complexas e específicas de um domínio. A detecção de turnos configurável permite ajustar a identificação do fim de turno para priorizar velocidade ou exatidão.
Com essas melhorias, os agentes transcrevem nomes e termos técnicos com mais confiabilidade e permitem configurar a latência e a exatidão da detecção de fim de turno.
Prompting com termos-chave: transcreva entidades difíceis com mais exatidão
Marcas, nomes de medicamentos e termos de setores específicos são naturalmente difíceis de transcrever, mesmo para os melhores modelos STT.
Com esse recurso, você pode enviar até 100 termos-chave, somando 1,200 caracteres, no parâmetro de consulta keyterm ao abrir uma conexão. O Ink-2 passa a favorecer a transcrição correta desses termos, sem aumentar a latência.
Nesta demonstração, um profissional de saúde explica a um paciente uma mudança na prescrição. Ink-2 e Deepgram Flux receberam os mesmos três termos-chave. As gravações e transcrições mantêm o idioma original.
Termos-chave fornecidos aos dois modelos:
ink-2
Retorna os três termos-chave como foram fornecidos
flux-general-en
Transcreve "Paracetamol" incorretamente
O prompting com termos-chave do Ink-2 também é eficaz para acertar nomes.
Termos-chave fornecidos aos dois modelos:
ink-2
Retorna os dois termos-chave como foram fornecidos
flux-general-en
Não identifica nenhum dos dois termos-chave
Medimos a revocação de palavras-chave no Earnings22, um benchmark baseado em conferências reais de resultados trimestrais. Ele inclui nomes de empresas, símbolos de ações e siglas, o tipo de vocabulário que costuma ser difícil para STT de uso geral.
Revocação de palavras-chave com prompting de termos-chave
Quanto maior, melhor
O prompting com termos-chave aumenta em 20% a revocação do Ink-2, o modelo STT mais preciso. Com o recurso ativado, o Deepgram Flux deixa de identificar 13.5% das palavras-chave, enquanto o Ink-2 deixa de identificar apenas 6.2%, menos da metade.
O prompting com termos-chave funciona bem para:
- Nomes de produtos e marcas, como “Cartesia” e “Ink-2”
- Nomes de medicamentos e termos clínicos, como “semaglutide” e “atorvastatin”
- Nomes ou endereços na conta de quem liga
- Siglas do setor e jargão interno
Na nossa avaliação, o Ink-2 apresentou uma melhora mensurável no EVA-Bench, nosso benchmark de IA desenvolvido para empresas. Ele lida bem com o vocabulário específico que aparece em conversas empresariais reais, em aviação, serviços de TI e RH. Os ganhos entre as avaliações vieram das melhorias da própria Cartesia, sem nenhum ajuste da nossa parte.
Detecção de turnos configurável: ajuste para menor latência ou maior exatidão
A detecção de turnos configurável permite ajustar a latência e a exatidão da identificação do fim de turno para otimizar o fluxo de conversa do agente para seu caso de uso.
Lower latency
Encerra o turno mais cedo
Encerra um turno em cada pausa, dividindo o pedido em três para que o agente comece a responder mais cedo.
Higher turn-taking accuracy
Mantém o turno aberto por mais tempo
Espera durante as pausas da pessoa e mantém o pedido inteiro em um único turno.
O Ink-2 vem com uma configuração padrão equilibrada, mas agora você pode ajustar a detecção de turnos. Priorize menor latência para conversas ágeis ou maior exatidão na alternância de turnos quando registrar corretamente as informações for mais importante. Defina a configuração ao abrir a conexão ou ajuste durante a transmissão, conforme a chamada avança.
Experimente hoje
O prompting com termos-chave e a detecção de turnos configurável já estão disponíveis para todos os usuários do Ink-2. Consulte a documentação de termos-chave e de detecção de turnos e experimente o Ink-2 em play.cartesia.ai.
