Blog / Produto

Apresentamos Ink: fala para texto em conversas em tempo real

Arjun Desai 
Apresentamos Ink: fala para texto em conversas em tempo real

Hoje apresentamos Ink, uma família de modelos de fala para texto (STT) em streaming para desenvolvedores de aplicações de voz em tempo real. O primeiro é Ink-Whisper, uma variante do Whisper da OpenAI otimizada para transcrição de baixa latência em conversas. Disponível hoje, Ink-Whisper é o modelo STT mais rápido e acessível, criado para agentes de voz empresariais.

De Sonic a Ink: da saída à entrada de voz

Com Sonic, nos tornamos o fornecedor de texto para fala preferido de quem prioriza velocidade, qualidade e confiabilidade. Sua liderança em latência ultrabaixa permite que clientes criem experiências de voz interativas realistas. Agora voltamos a atenção ao outro lado da conversa, a transcrição, com Ink.

Repensando Whisper para tempo real

Para lançar nosso STT, analisamos o que os desenvolvedores já usam e onde estão os problemas. Isso nos levou ao whisper-large-v3-turbo da OpenAI. Sua adoção tem boas razões: precisão conversacional comparável à de fornecedores proprietários, código aberto e inferência eficiente.

Grande parte da inovação em Whisper busca aumentar a vazão, isto é, a velocidade de transcrição de conjuntos enormes de dados, medida pelo fator de tempo real (RTF). Isso ajuda no pós-processamento de arquivos longos, mas Whisper padrão fica aquém em velocidade e precisão para agentes em tempo real, nos quais a qualidade deve ser alta em cada chamada, não só no agregado. Ele também não foi projetado para condições reais difíceis.

Whisper foi criado para processamento em lote, não diálogo ao vivo. Por isso o reestruturamos no Ink-Whisper, com velocidade e contexto real no centro da IA de voz em tempo real.

Criado para conversas reais

Em empresas, agentes precisam transcrever enquanto a pessoa fala e manter a confiabilidade em ambientes variados. Focamos nas condições que costumam causar problemas aos sistemas STT:

  • Artefatos de telefonia: áudio comprimido de baixa largura de banda acrescenta distorção.
  • Nomes próprios e termos especializados: produtos, medicamentos e instrumentos financeiros exigem clareza.
  • Ruído de fundo: trânsito, restaurantes, bebês chorando e estática dificultam a transcrição.
  • Hesitações e silêncio: interjeições como “hum” e pausas confundem implementações padrão.
  • Sotaques e variações: há muitos tipos de voz, e o modelo precisa se adaptar.

Uma melhoria central é a divisão dinâmica em segmentos. Whisper padrão funciona melhor com blocos completos de 30 segundos, mas a IA conversacional recebe segmentos menores e fragmentados. Nós o modificamos para aceitar comprimentos variáveis que terminam em pontos semanticamente relevantes. Isso reduz erros e alucinações, sobretudo durante silêncio ou lacunas.

Criamos conjuntos de avaliação que representam esses desafios para verificar o desempenho fora do laboratório:

  • Ruído de fundo: conversas gravadas no trânsito, em cafés e em escritórios.
  • Nomes próprios: 100 amostras do SPGISpeech com muitos termos financeiros e marcas.
  • Sotaques: transcrições com diversos sotaques do inglês para testar diferentes grupos de falantes.

Nesses conjuntos, Ink-Whisper supera whisper-large-v3-turbo em taxa de erro de palavras (WER). Seu WER também é competitivo com outros modelos em streaming, com otimização para produção em tempo real:

Taxa de erro de palavras por conjuntoDetalhesCartesia Streaming whisper-naturalDeepgram Nova3 StreamingFireworks Whisper StreamingAssembly Streaming
Chamadas telefônicasConversas naturais ao telefone0.190.180.280.23
Nomes própriosFala com muito jargão0.0650.0450.0710.044
Ruído de fundoRuído ambiente0.0330.0380.0990.027
HesitaçõesInterjeições e ruído0.0640.0550.1560.137
Subconjunto Speech Accent ArchiveSotaques diversos0.0150.0240.0140.016

O modelo de transcrição em streaming mais rápido

Além da precisão, a velocidade é necessária para conversas realistas. Com Ink-Whisper, destacamos o tempo até a transcrição completa (TTCT): quanto demora para o texto inteiro ficar pronto depois que o usuário para de falar. Ele determina a rapidez da resposta de todo o sistema, como um ouvinte atento ao vivo.

O atraso na resposta denuncia um bot pouco natural, quebra o ritmo e pode gerar chamadas encerradas, frustração e perda de receita. Reduzir o TTCT é uma questão de velocidade e de fazer a interação parecer humana.

Ink-Whisper supera whisper-large-v3-turbo em TTCT. Ele entrega o menor TTCT entre todos os modelos STT em streaming que testamos:

Tempo para completar a transcrição após o último áudio enviadoCartesia Streaming Ink-WhisperDeepgram Nova3 StreamingFireworks Whisper StreamingAssemblyAI Universal Streaming
Mediana (ms)667470737
P90 (ms)98109189829

Whisper continua entre os modelos STT abertos mais versáteis, mas não foi feito para tempo real. Ink-Whisper muda isso com precisão conversacional e latência ultrabaixa. Ele entrega o menor TTCT que observamos e bom desempenho com ruído, sotaques e fala dinâmica. Avaliamos nas condições reais de agentes, não em um laboratório ou estúdio controlado.

O modelo em streaming mais acessível

Acreditamos no futuro da voz e tornamos Ink-Whisper acessível a quem cria essas soluções. Ele é o modelo STT em streaming mais rápido e barato disponível. Por apenas um crédito por segundo, ou US$ 0,13 por hora no plano Scale, oferece transcrição de alto nível em tempo real pelo menor preço.

Para começar:

  • Ink-Whisper se integra a Vapi, Pipecat e LiveKit, permitindo iniciar interações em streaming em minutos.
  • Com 99,9% de disponibilidade e conformidade empresarial SOC 2 Type II, HIPAA e PCI, você pode implantar em escala com confiança.

Comece aqui ou consulte a documentação.

O futuro da IA de voz com a Cartesia

A demanda por agentes de voz cresce rapidamente. Os mais eficazes usam modelos avançados como Sonic. Com Ink-Whisper, atendemos também ao outro lado da conversa, permitindo interações rápidas e naturais. Este lançamento é uma primeira amostra de como estamos repensando a infraestrutura de voz em tempo real. Há mais por vir.