A conversão de texto em fala neural (TTS neural) é a síntese de voz em que uma rede neural, treinada com horas de pessoas falando, gera o áudio. Antes, os computadores colavam trechos de fala gravada ou calculavam uma voz a partir de regras escritas à mão. O TTS neural aprende pronúncia, ritmo e entonação a partir de dados, e é por isso que soa como uma pessoa, e não como um GPS anunciando “recalculando rota”.
Se você chegou aqui porque um menu de configurações ou um console de nuvem ofereceu uma voz “neural”: escolha essa. Ela vai soar bem mais natural. Na fatura de nuvem, costuma custar cerca de quatro vezes mais que uma voz padrão; a seção de preços abaixo explica.
Se você está escolhendo um modelo de voz para um produto, a pergunta útil em 2026 é qual TTS neural você quer. Quase todas as vozes que você vai comparar são neurais. Elas diferem na forma de gerar áudio, na rapidez com que começam a falar e em como lidam com o texto que seu produto realmente envia.
O que existia antes do TTS neural
Duas abordagens mais antigas ainda estão por trás das vozes “padrão” da maioria das plataformas em nuvem.
A síntese concatenativa corta gravações de um locutor real em unidades pequenas e as junta de novo. A documentação do Amazon Polly descreve assim seu motor padrão: ele “concatena fonemas de fala gravada”, e as emendas entre as unidades limitam o quanto pode soar natural.
A síntese paramétrica dispensa gravações na hora de reproduzir. Um modelo prevê parâmetros acústicos e um vocoder de processamento de sinal os transforma em som. A página de tipos de voz do Google Cloud diz que muitas de suas vozes padrão usam uma variação disso. É flexível e compacta, e é a origem daquele som meio zumbido e robótico que associamos ao texto para fala antigo.
Como o TTS neural funciona
Um sistema típico de TTS neural tem três etapas.
- Uma etapa inicial normaliza o texto. “Dr. Lee, 221B Baker St., US$ 4,50” precisa virar palavras que um locutor diria, e o modelo precisa saber como ler cada abreviação e cada número no contexto.
- Um modelo acústico prevê como a fala deve soar, geralmente como um espectrograma mel, uma imagem de como a energia se distribui entre as frequências ao longo do tempo. É aqui que a rede decide ritmo, ênfase e tom.
- Um vocoder neural transforma esse espectrograma em uma forma de onda que pode ser reproduzida.
Vale conhecer os marcos, porque os fornecedores ainda dão os nomes deles a produtos. O WaveNet (2016), da DeepMind, gerava áudio amostra por amostra, e ouvintes o avaliaram como mais natural que os melhores sistemas paramétricos e concatenativos da época. O Tacotron 2 (2017), do Google, combinou um preditor de espectrogramas com um vocoder WaveNet e obteve nota média de opinião de 4,53, contra 4,58 de gravações profissionais. O HiFi-GAN (2020) deixou o vocoding de alta qualidade rápido o bastante para ser barato. O motor neural da Amazon segue o mesmo desenho em duas partes: uma rede sequência a sequência que gera espectrogramas, seguida de um vocoder neural.
A nova geração: fala como tokens
Desde cerca de 2023, muitos sistemas deixaram o espectrograma de lado. Um codec de áudio neural, como o EnCodec da Meta, comprime o áudio em uma sequência de tokens discretos. Um modelo prevê esses tokens como um modelo de linguagem prevê palavras, e o codec os transforma de volta em som. O VALL-E, da Microsoft, mostrou a vantagem: treinado com 60.000 horas de inglês, conseguia imitar um novo locutor a partir de uma gravação de três segundos.
É isso que os provedores de nuvem vendem hoje como vozes “generativas” ou “HD”. A Amazon descreve seu motor generativo como um transformer de um bilhão de parâmetros que transforma texto em códigos de fala, seguido de um decodificador que os transmite como áudio. Esses modelos leem melhor uma frase com a intenção certa, riem na hora certa e soam como uma conversa. Há uma contrapartida. A Microsoft diz que suas vozes HD variam um pouco a cada saída, e a Amazon avisa que uma atualização do modelo pode mudar o som de uma voz. Se você produz uma temporada de podcast, isso importa. Se você atende ligações, quase nunca.
Onde entram os modelos de espaço de estados
Gerar fala em tempo real é um problema de sequências longas: alguns segundos de áudio são milhares de passos. A atenção de um transformer olha para tudo o que já foi gerado, então cada novo passo fica mais caro conforme o áudio cresce. Um modelo de espaço de estados carrega um resumo de tamanho fixo do passado, então cada passo custa o mesmo.
Os fundadores da Cartesia trabalharam nessa ideia antes de a Cartesia existir. Albert Gu e Karan Goel são coautores do S4, e Gu é coautor do Mamba com Tri Dao. O Sonic, modelo de TTS da Cartesia, é baseado nessa família de arquiteturas. Ele transmite o áudio enquanto gera, com latência de modelo abaixo de 90 ms, fala 44 idiomas, e o Sonic 3.6 ficou em primeiro lugar nos dois rankings de texto para fala da Artificial Analysis quando foi lançado, em agosto de 2026. Nós o criamos para agentes de voz, em que quem liga ouve cada milissegundo de atraso.
O que “neural” significa numa página de preços
Os provedores de nuvem usam a palavra como nível de preço. Veja o que Amazon e Google publicavam em 3 de outubro de 2026, por milhão de caracteres:
| Provedor | Vozes antigas | Neural | Nível mais novo |
|---|---|---|---|
| Amazon Polly | Standard: US$ 4 | Neural: US$ 16 | Generative: US$ 30; Long-Form: US$ 100 |
| Google Cloud | Standard: US$ 4 | Neural2: US$ 16 | Chirp 3: HD: US$ 30 |
Duas coisas chamam a atenção. Primeiro, os nomes não batem entre fornecedores, então compare pela arquitetura e ouvindo, não pelo rótulo. O Google agora cobra pelas vozes WaveNet, o grande avanço neural de 2016, os mesmos US$ 4 das vozes padrão. Segundo, o nível mais novo custa cerca do dobro do neural. Se vale a pena depende do seu texto e dos seus ouvintes, e só testando você descobre.
Como saber se uma voz neural é boa
Todo fornecedor vai dizer que suas vozes soam humanas. Os testes úteis são os que se parecem com o seu produto:
- Envie as strings que seus usuários vão ouvir: números de pedido, e-mails, datas, preços e nomes. Modelos neurais erram nelas de um jeito diferente de frases comuns.
- Ouça no contexto. Uma frase que soa bem sozinha pode ter o tom errado depois de um pedido de desculpas.
- Meça o caminho que o usuário vive. Numa conversa ao vivo, é o tempo até o primeiro áudio por uma conexão com streaming, não quanto demora para gerar um arquivo completo.
- Teste trechos longos e todos os idiomas que você vai lançar. O ritmo se desvia e sotaques aparecem de formas que demos curtas escondem.
Nossa equipe de pesquisa escreveu um texto mais longo sobre isso, Is this TTS model good?, que explica por que nenhuma nota única resolve a questão.
TTS neural de código aberto
Dá para rodar TTS neural de graça no seu próprio hardware. O Piper é um motor local rápido muito usado em automação residencial. O Kokoro é um modelo de 82 milhões de parâmetros com licença Apache. Os dois são boas opções para ler texto em voz alta num dispositivo sem conexão de rede. Eles não foram feitos para streaming de baixa latência no volume de uma central de atendimento, que é o trabalho do Sonic.
Para ouvir a diferença, cole uma frase que o seu produto diz no playground da Cartesia. O plano gratuito inclui créditos suficientes para testar com o seu próprio texto.