Converta texto em fala em um arquivo MP3
Digite seu texto, escolha uma voz e crie seu MP3.
Seu roteiro, pronto para reproduzir
Confira a voz com um trecho curto e gere um arquivo para o player. Guarde o roteiro original para revisar a gravação depois.
Prepare o roteiro
Escreva o texto que deseja no arquivo. Escreva por extenso as abreviações pouco conhecidas e revise nomes, datas e números antes de gerar a gravação final.
Ouça uma prévia
Teste seu texto na prévia e compare vozes. Ouça a interpretação antes de criar o arquivo MP3.
Salve o MP3
Selecione Criar MP3 e baixe o arquivo de áudio. Ouça mais uma vez no player que seu público usará.
Gere um MP3 pela API
Envie seu roteiro ao Sonic e salve a resposta como MP3 para narração, aulas ou reprodução no app.
Configure sua solicitação
Escolha a saída MP3 e inclua a transcrição, a voz e o modelo em uma solicitação à API Bytes. Envie pelo backend para manter sua chave de API privada.
Salve a resposta de áudio
Confira se a solicitação foi concluída antes de salvar os bytes da resposta como um arquivo MP3. Trate primeiro os erros da API e reproduza o áudio salvo para conferir o resultado.
- Formato
- MP3
- Taxa de amostragem
- 44.1 kHz
- Taxa de bits
- 128 kbps
Escolha um formato para seu destino
Comece pelo que o player aceita. Uma integração telefônica e um arquivo de narração para download podem precisar de configurações diferentes.
MP3
Para reprodução e compartilhamento
Áudio comprimido para narração, mensagens de apps e players que aceitam MP3. Escolha a taxa de bits e a taxa de amostragem na solicitação.
WAV
Para um fluxo de edição
Um contêiner de arquivo para áudio PCM. Útil quando seu editor ou fluxo de publicação espera WAV em vez de MP3 comprimido.
Áudio bruto
Para uma integração
Amostras de áudio sem cabeçalho de arquivo. Faça a codificação e a taxa de amostragem corresponderem ao player ou sistema telefônico.
Coloque o arquivo em uso
Mensagens telefônicas fixas
Gere saudações e mensagens de fora do horário de atendimento a partir de texto aprovado. Confirme se seu sistema telefônico aceita MP3 antes de enviar; alguns exigem WAV ou áudio bruto.
Áudio na aplicação
Salve instruções faladas ou mensagens curtas para reprodução na aplicação. Mantenha o texto original junto de cada arquivo para saber qual versão os usuários ouvirão.
Avaliação de voz
Compare vozes usando as mesmas frases de teste. Revise pronúncia e ritmo antes de escolher uma voz para um agente que atende clientes.
Perguntas frequentes sobre texto para MP3
Como configuro o formato de saída da API como MP3?
Use o endpoint Text-to-Speech Bytes. Defina output_format como {"container":"mp3","sample_rate":44100,"bit_rate":128000}. Inclua os demais campos obrigatórios da solicitação e a autenticação indicados na referência. Isso seleciona um MP3 de 44,1 kHz a 128 kbps; é uma configuração disponível, não uma exigência para todas as aplicações. A resposta contém bytes de áudio, não uma URL de download em JSON.
Posso baixar o resultado como arquivo MP3?
Sim. Digite seu texto na ferramenta acima, escolha uma voz e selecione Criar MP3. Quando o arquivo estiver pronto, selecione Baixar MP3. Para uma aplicação, solicite MP3 à API Bytes e salve a resposta bem-sucedida como arquivo .mp3.
Texto para fala em MP3 é gratuito?
Você pode ouvir e baixar amostras curtas de MP3 nesta página sem uma conta. A geração pela API usa os créditos da sua conta. Veja os planos atuais da Cartesia para conferir créditos incluídos, uso adicional e condições de uso comercial.
Devo usar MP3 ou PCM para um agente de voz em tempo real?
Use o formato esperado pela integração receptora. MP3 comprime áudio para reprodução de arquivos; PCM representa amostras de áudio sem compressão MP3. Uma chamada ao vivo pode exigir uma codificação bruta e uma taxa de amostragem específicas em vez de MP3. Consulte o guia de integração de áudio antes de selecionar as configurações de saída. Um download rápido de arquivo não mede a latência da conversa de ponta a ponta.
Quais idiomas e controles de voz posso usar?
Consulte a documentação atual dos modelos Sonic para verificar a cobertura de idiomas. Os modelos compatíveis têm controles de volume, velocidade e emoção. Teste a voz escolhida em cada idioma desejado. Preste atenção em nomes, abreviações e números; a geração de fala ainda precisa de revisão para seu caso de uso.
Posso usar fala gerada em uma saudação de URA?
Sim, se seu sistema telefônico aceitar o formato do arquivo e você tiver os direitos necessários sobre a voz e o texto. Gere saudações fixas a partir de textos aprovados e teste-as por uma conexão telefônica. Uma saudação pré-gravada não interpreta a resposta de quem liga. Para chamadas interativas, conheça o Cartesia Managed Agents.
A prévia desta página baixa um MP3?
Sim. Criar MP3 gera um arquivo com o texto, a voz e o idioma selecionados. Baixar MP3 aparece quando a geração termina. Editar o texto ou mudar a voz remove o download anterior para que você crie um novo arquivo com a seleção atualizada.
Qual é a diferença entre taxa de amostragem e taxa de bits de um MP3?
A taxa de amostragem descreve quantas vezes o áudio é amostrado por segundo. A taxa de bits descreve quanto dado de áudio comprimido é armazenado por segundo. Escolha configurações disponíveis adequadas ao seu reprodutor. O exemplo desta página usa 44100 amostras por segundo e 128000 bits por segundo; essas configurações não são obrigatórias para todos os projetos.
Posso transformar um documento ou PDF em MP3?
Copie o texto que deseja ouvir e revise-o antes de gerar o áudio. Remova números de página, títulos repetidos e outros elementos que não devem ser lidos em voz alta. A API de fala aceita texto; ela não extrai texto de um PDF enviado nesta página.
Por que meu MP3 salvo não toca?
Primeiro, verifique se a solicitação da API foi bem-sucedida e se você salvou a resposta como áudio binário. Confirme que solicitou um contêiner MP3 e que o reprodutor aceita as configurações escolhidas. Mudar o nome de um arquivo WAV para terminar em .mp3 não converte o formato do áudio.
Como devo preparar um texto longo para narração em MP3?
Comece com um trecho curto para escolher a voz e conferir a pronúncia. Organize um texto mais longo em seções que possa revisar individualmente e mantenha as mesmas configurações de voz e saída entre elas. Ouça cada junção antes de montar a narração final no editor. Mantenha uma cópia do texto original para que uma correção futura não exija reescrever tudo.
Continue trabalhando com sua voz
Compare vozes para o próximo roteiro ou aprenda a gerar fala pela sua aplicação.
Encontre uma voz para seu roteiro
Compare vozes em um trecho curto antes de produzir o arquivo final. Use o gerador de voz para ouvir como cada voz interpreta suas palavras.
Experimente o gerador de vozGere áudio com Python
Configure o SDK de Python e faça sua primeira solicitação de texto para fala. Comece com o exemplo completo e escolha o formato de saída de que o projeto precisa.
Desenvolva com PythonComece hoje
Fale com um especialista.
Converse com alguém da nossa equipe e descubra como a Cartesia pode ajudar você a criar experiências de voz de alto nível.
Comece a criar.
Acesse nossos modelos por API e coloque um agente de voz em produção em minutos.