Ink: o modelo de fala para texto mais rápido e preciso
Esta demonstração do Ink 2 aceita inglês, espanhol, francês, hindi e japonês. Fale inglês nesta demonstração.
Junte-se às equipes que estão migrando para a Cartesia
Um modelo de transcrição para todos os ambientes aos quais seu negócio leva você
Trens passam fazendo barulho e anúncios ecoam nos alto-falantes. O Ink-2 transcreve cada palavra de quem liga.
Cidade barulhenta
Criado para agentes de voz
Quatro capacidades que fazem do Ink a camada de transcrição em que agentes de produção confiam.
Precisão
Entende certo de primeira.
Na prática
Em um agente de voz, a transcrição é a base de tudo. Um erro de transcrição compromete a entrada do LLM e leva a interação na direção errada.
O inverso também vale: a precisão se acumula, e uma transcrição exata significa uma resposta melhor e uma chamada que resolve.
A abordagem do Ink-2
O Ink tem a menor taxa de erro de palavras (WER) entre os modelos de STT em streaming, lidando nativamente com dados estruturados, como números de telefone, datas, e-mails, moedas e UUIDs. Feito para ambientes reais de áudio, incluindo telefonia, ruído de fundo, sotaques variados e muito mais.
Datas, sequências alfanuméricas e IDs
Fluxo da conversa
Sabe quando você começa e termina.
Na prática
Uma conversa tem dois momentos decisivos: quando a pessoa começa a falar e quando termina. Se perder o início, o agente perde o turno inteiro. Se reagir cedo demais ao fim, o agente interrompe o raciocínio. O modelo certo de transcrição acerta os dois sem fazer esperar.
A abordagem do Ink-2
O Ink-2 tem detecção nativa de turnos: turn.start e turn.end são sinalizados diretamente pelo modelo, sem VAD externo para integrar ou manter. Para menor latência, turn.eager_end permite que seu LLM comece antes de o fim do turno ser confirmado.
A detecção semântica de fim de turno usa o significado, não o silêncio, para que pausas no meio do raciocínio não acionem o agente antes da hora.
ink-2
Seu agente pode responder antes mesmo de o concorrente começar
flux-general-en
Só agora o agente sabe que a pessoa terminou de falar; ele começa do zero
Velocidade
A pessoa para de falar.
O agente começa a pensar.
Na prática
Quando a transcrição é rápida e consistente, a resposta do agente parece imediata. Uma transcrição lenta em dez significa uma chamada em dez em que essa prontidão falha. Nove chamadas ótimas não anulam aquela que não pareceu certa.
A abordagem do Ink-2
O Ink é o modelo de ASR em streaming mais rápido, construído sobre um motor de inferência próprio feito para conversas em tempo real. O tempo até a transcrição final é de 0,1 s, com turn.eager_end reduzindo o intervalo entre a última palavra e a primeira resposta.
Custo
Qualidade que não custa mais conforme você cresce.
Na prática
A voz é a interface mais natural de comunicação. Acertar custo e qualidade em escala permite levar voz a todos os lugares, como interface padrão em cada interação com agentes.
A abordagem do Ink-2
A arquitetura de Modelos de Espaço de Estados do Ink oferece de 10 a 100 vezes a capacidade de processamento dos transformers, com menor custo computacional em escala e sem comprometer a qualidade. A otimização contínua da nossa pilha de modelos melhora os custos unitários conforme você cresce.
Segurança de nível empresarial.Da nuvem ao ambiente local.
Em conformidade com a HIPAA

SOC 2 Type 2

GDPR

PCI
Perguntas frequentes
Por que o Ink-2 é o melhor STT para agentes de voz?
O Ink-2 é o modelo de fala para texto em streaming da Cartesia, desenvolvido para agentes de voz em produção. Assim como nosso TTS, ele usa a arquitetura de Modelos de Espaço de Estados (SSM), na qual nossa equipe fundadora foi pioneira em Stanford. É isso que permite ao Ink-2 entregar três coisas ao mesmo tempo:
A menor WER entre os modelos de STT em streaming. O Ink-2 supera Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro, ElevenLabs Scribe-2-realtime e outros modelos de streaming em produção em gravações de linha telefônica, fala com sotaque, ambientes ruidosos e teleconferências de resultados, incluindo sequências alfanuméricas como números de telefone, e-mails e UUIDs.
Detecção de turnos de referência, integrada. O Ink-2 tem detecção de fim de turno integrada ao modelo, ou seja, você não precisa de um modelo separado de alternância de turnos, como o Silero, na sua pilha. Menos dependências, menor latência e alternância de turnos mais precisa.
Resistência a ruído integrada. O Ink-2 lida com ruído de fundo sem exigir Krisp ou outros filtros de áudio, eliminando custo e latência da sua pilha.
Ainda preciso de Krisp ou Silero com o Ink-2?
Não. Esse é um dos principais motivos pelos quais as equipes migram para o Ink-2:
A alternância de turnos já vem integrada. A maioria dos modelos de STT exige um detector de turnos externo, como o Silero, para saber quando o usuário terminou de falar. O Ink-2 faz isso de forma nativa, com mais rapidez e precisão do que a execução de um modelo separado.
A resistência a ruído já vem integrada. A maioria dos agentes de voz adiciona Krisp ou filtros de áudio semelhantes ao STT para remover ruído de fundo, aumentando custo, latência e complexidade. O Ink-2 lida com ruído de fundo sem configuração adicional.
Menos modelos na sua pilha significam menor latência, menor custo e menos pontos de falha.
O Ink-2 pode ser executado no meu ambiente local ou na minha própria nuvem (VPC)?
Sim, o Ink-2 pode ser implantado:
Localmente no seu data center, incluindo ambientes isolados da rede
Na sua própria VPC na AWS, no GCP ou no Azure
Por licenciamento OEM para incorporar o Ink-2 diretamente ao seu produto
Isso torna o Ink-2 viável para contratos governamentais, setores regulamentados (saúde, serviços financeiros e seguros) e clientes com requisitos de soberania ou residência de dados. Implantações locais e OEM estão disponíveis por meio de contratos empresariais.
Quais idiomas o Ink-2 aceita?
O Ink-2 oferece suporte a inglês, espanhol, francês, hindi e japonês.
Quanto custa o Ink-2?
O Ink-2 custa 3 créditos por segundo. Os detalhes de preços e descontos por volume estão na página https://www.cartesia.ai/pricing. Os contratos Enterprise incluem preços personalizados conforme o uso e o modelo de implantação.
A Cartesia também oferece um programa de apoio a startups em https://www.cartesia.ai/startups com créditos para empresas em estágio inicial que atendam aos critérios.
Quando devo falar com vendas?
Entre em contato com a equipe da Cartesia se alguma destas situações se aplicar:
Você executa cargas de produção de alto volume (>50 milhões de créditos)
Você precisa de implantação local, em VPC ou OEM
Você precisa de um BAA, retenção zero de dados ou outros termos contratuais de conformidade para saúde, serviços financeiros ou setores regulamentados
Você trabalha com compras governamentais, federais ou do setor público
Para os demais casos, como avaliação, prototipagem e cargas menores de produção, os planos de autoatendimento e a documentação técnica em https://docs.cartesia.ai/build-with-cartesia/stt-models/latest ajudam você a começar.
Comece hoje
Fale com um especialista.
Converse com alguém da nossa equipe e descubra como a Cartesia pode ajudar você a criar experiências de voz de alto nível.
Comece a criar.
Acesse nossos modelos por API e coloque um agente de voz em produção em minutos.





