Síntese de fala para agentes de voz em tempo real

Transforme texto em áudio falado com o Sonic, o modelo de texto para fala da Cartesia. Experimente uma voz no Playground e gere áudio a partir da sua aplicação pela API.

Ouça a voz com suas palavras

Teste uma frase que sua aplicação diria. Compare vozes com as mesmas palavras e ouça a pronúncia e o ritmo.

144/500

Adicione fala à sua aplicação

O Sonic transforma o texto produzido pela sua aplicação em áudio. Sua aplicação fornece a resposta; o modelo de voz a pronuncia.

Escolha uma voz

Teste vozes com as palavras que sua aplicação realmente vai dizer. Inclua nomes, números e abreviações na avaliação, em vez de depender apenas de uma saudação.

Gere áudio pela API

Envie texto da sua aplicação e receba áudio sintetizado. Escolha uma voz e um formato de saída e reproduza a resposta ou salve-a como arquivo.

Transmita respostas faladas

Use áudio em streaming para reprodução em conversas. Meça o tempo até os usuários ouvirem a fala na sua aplicação, incluindo transferência pela rede e buffer de reprodução.

Reprodução no navegador ou uma API de fala?

Os dois convertem texto em fala. Escolha de acordo com onde você quer executar a voz e como sua aplicação precisa usar o áudio.

Síntese de fala no navegador

Use a interface SpeechSynthesis do navegador para reproduzir com as vozes do dispositivo. As vozes disponíveis dependem do navegador e do sistema operacional.

Ideal para Leitura de texto em voz alta em uma página web.

Leia o guia de TTS no navegador

API de fala da Cartesia

Escolha uma voz do Sonic pelo ID e gere fala pelo backend. Transmita, salve ou reproduza o áudio em aplicações web, móveis e telefônicas.

Ideal para Geração de áudio para sua aplicação.

Explore a API de fala

Vozes realistas e expressivas para cada caso de uso

Ouça amostras de fala para diferentes aplicações. Compare a interpretação e teste uma voz com as palavras que seu público ouvirá.

Suporte

Áudio original em inglês

Transforme respostas de suporte ao cliente em respostas faladas com síntese de fala. Leia atualizações de serviço e etapas de solução de problemas com uma voz consistente em chamadas e aplicações.

Jogos

Gravação original

Gere diálogos de personagens a partir dos textos do seu jogo. Compare vozes para cada papel e ouça novas falas no contexto para conferir ritmo e interpretação.

Conteúdo

Gravação original

Crie locuções para vídeos, tutoriais e explicações de produtos a partir de texto. Revise um texto e gere nova narração sem gravar cada fala novamente.

Mídia

Gravação original

Transforme artigos e histórias escritos em áudio falado. Use texto para fala em aberturas de podcasts ou notícias narradas, conferindo nomes e pronúncia antes de publicar.

Saúde

Áudio original em inglês

Leia lembretes de consultas e informações de atendimento ao paciente a partir de textos revisados pela sua equipe. Use uma voz consistente para instruções de rotina e atualizações de agendamento.

Vendas

Áudio original em inglês

Adicione narração falada a demonstrações de produtos e explicações de vendas. Teste seu texto com vozes diferentes e atualize o áudio quando o produto ou a mensagem mudar.

Agentes de voz

Áudio original em inglês

Dê aos agentes de voz com IA respostas faladas geradas a partir do texto da sua aplicação. Escolha uma voz para saudações e conversas e teste como ela soa em respostas curtas e mais longas.

Dublagem

Áudio original em japonês

Gere fala a partir de textos traduzidos para seu fluxo de localização. Compare vozes nos idiomas disponíveis e revise pronúncia e sincronização antes de adicionar o áudio a um vídeo.

Avatares

Gravação original

Combine um avatar digital com fala sintetizada para apresentações e experiências guiadas. Gere diálogo a partir de texto e coordene a reprodução do áudio com a animação do avatar.

Logística

Áudio original em inglês

Transforme atualizações de remessas e instruções de despacho em mensagens faladas. Conecte a síntese de fala à sua aplicação para que o áudio reflita as informações mais recentes de entrega.

Recrutamento

Gravação original

Crie apresentações faladas de entrevistas e mensagens de agendamento para candidatos a partir de textos aprovados. Mantenha as instruções consistentes e gere novamente o áudio quando o processo seletivo mudar.

Acessibilidade

Gravação original

Ofereça versões em áudio de guias escritos, artigos e materiais de aprendizagem. Permita que as pessoas ouçam o conteúdo e acompanhem o texto original no próprio ritmo.

Fluente e nativo, no mundo todo

Alcance mercados internacionais com o Sonic: 44 idiomas e uma ampla variedade de sotaques, todos com vozes de qualidade equivalente à de falantes nativos.

Variantes regionais mais populares

De uma demonstração de voz a uma conversa

A síntese de fala é a resposta falada. Um agente conversacional também precisa entender a entrada, decidir o que dizer e lidar com interrupções.

Crie seu fluxo de áudio

Use a API Bytes quando a transcrição estiver pronta ou um WebSocket quando o texto chegar em blocos. Faça o formato de saída corresponder ao player e interrompa o áudio pendente quando o usuário interromper.

Leia o guia de WebSocket

Desenvolva com o Managed Agents

Conecte uma voz às instruções e ferramentas do agente. Use o Managed Agents quando quiser trabalhar na conversa junto com a voz.

Explore o Managed Agents

Perguntas frequentes sobre síntese de fala

O que é síntese de fala?

A síntese de fala gera áudio falado a partir de texto. Também é chamada de texto para fala ou TTS. O modelo Sonic da Cartesia executa essa etapa em uma aplicação de voz. O reconhecimento de fala faz o contrário: converte áudio falado em texto.

A Cartesia é o mesmo que a API SpeechSynthesis do navegador?

Não. O window.speechSynthesis do navegador usa vozes disponíveis no dispositivo do ouvinte e gerencia a reprodução nele. A Cartesia é uma API hospedada que retorna áudio gerado à sua aplicação. Se você precisa apenas de reprodução no navegador sem chave de API, experimente o tutorial de texto para fala em JavaScript. As vozes do navegador variam por sistema operacional e podem usar serviços de fala locais ou remotos.

Como integro síntese de fala a uma aplicação?

Comece pelo guia de texto para fala em Python para gerar e salvar um arquivo WAV. Mantenha sua chave de API no backend. Para um agente de voz, você também precisa de reprodução de áudio e tratamento de interrupções; um exemplo que salva arquivos não implementa essas partes. Você também pode criar com o Cartesia Managed Agents.

A síntese de fala sempre pronuncia o texto corretamente?

Teste a voz escolhida com nomes, abreviações e números da sua aplicação. Ouça as palavras no contexto e revise o texto quando necessário. Uma amostra representativa ajuda você a escolher uma voz adequada ao conteúdo.

Quais idiomas a Cartesia aceita?

Veja a lista atual de idiomas do Sonic e ouça exemplos dos idiomas desejados. Forneça texto no idioma que quer ouvir; o TTS não o traduz automaticamente.

Posso usar a síntese de fala da Cartesia offline ou gratuitamente?

A API hospedada da Cartesia exige conexão com a internet e acesso a uma conta. Áudio gerado e salvo como arquivo pode ser reproduzido offline. O uso depende do plano e dos limites da conta; consulte os preços atuais antes de executar solicitações.

Síntese de fala é o mesmo que reconhecimento de fala?

A síntese de fala transforma texto em áudio falado. O reconhecimento de fala transforma áudio em texto. Um agente de voz pode usar reconhecimento para entender quem liga, um modelo de linguagem para produzir uma resposta e síntese de fala para falar essa resposta. Veja o Sonic para texto para fala e o Ink para fala para texto.

Posso transmitir a fala enquanto ela é gerada?

Sim. A Cartesia oferece endpoints de streaming para receber áudio de forma incremental. Sua aplicação pode iniciar a reprodução conforme o áudio chega. Consulte a referência da API de streaming para ver o formato de resposta e implemente a reprodução de acordo com as configurações de áudio esperadas pela integração.

Posso controlar a velocidade e a emoção da fala sintetizada?

Os modelos Sonic compatíveis oferecem controles de velocidade, volume e emoção. Teste as configurações com a voz e o texto escolhidos para ouvir como afetam a interpretação. O guia de controles de voz explica os controles atuais e o suporte dos modelos.

A síntese de fala pode traduzir texto para outro idioma?

Forneça o texto no idioma que deseja ouvir. Traduzir o texto é uma etapa separada da síntese da voz. Revise nomes, números e expressões regionais traduzidos antes de gerar o áudio final. Explore os exemplos de idiomas para ouvir vozes antes de escolher uma.

Qual é a diferença entre clonagem de voz e síntese de fala?

A clonagem de voz cria uma voz reutilizável a partir das gravações de um falante. A síntese de fala usa uma voz para ler novo texto. Você pode começar com uma voz existente ou criar uma voz clonada que tenha permissão para usar e gerar fala com seu ID. Consulte o guia de clonagem de voz para ver os requisitos de gravação.

Comece hoje

Fale com um especialista.

Converse com alguém da nossa equipe e descubra como a Cartesia pode ajudar você a criar experiências de voz de alto nível.

Fale com vendas

Comece a criar.

Acesse nossos modelos por API e coloque um agente de voz em produção em minutos.

Experimente a Cartesia