Um modelo de texto para fala, ou TTS, gera fala. Mas o modelo e a voz que ele usa são coisas diferentes.
Se você conhece LLMs, pense na voz como algo vagamente semelhante a um prompt de sistema. O modelo fornece a capacidade geral, e a entrada molda o que ele gera.
Em TTS, a voz costuma ser uma entrada separada do modelo e molda sua resposta. Essa resposta, o áudio, é muito mais complexa que um texto. Modelos que geram fala precisam saber o que dizer, como dizer, em que ritmo e volume, com qual entonação, prosódia e ênfase. São todas as características e métricas de uma “boa voz”. Normalmente, você gostaria de passar essas instruções ao modelo, mas a maioria dos modelos TTS aceita apenas uma ou duas entradas, a transcrição e uma voz selecionada.
Entradas dos modelos de voz
Um modelo de locutor fixo recebe uma única entrada, a transcrição. Ele é treinado para falar com uma única voz, codificada nos pesos aprendidos do modelo. Não recebe uma voz como entrada.
Por isso, qualquer transcrição fornecida resulta em áudio que sempre soa como a mesma pessoa.
Modelo de locutor fixo + transcrição = fala em uma única voz
Quando a única voz disponível é a que acompanha o modelo, os dois parecem a mesma coisa. No uso normal, não é possível separá-los claramente. Para produzir a fala de outra pessoa, é preciso adaptar ou treinar novamente o modelo.
Já um modelo com vários locutores aceita a seleção de voz como outra entrada. Você fornece a transcrição e escolhe uma voz de uma lista fixa compatível com o modelo.
Modelo com vários locutores + transcrição + locutor selecionado = fala nessa voz
O modelo de síntese de fala continua o mesmo, enquanto a voz escolhida muda as características da fala produzida.
Mantenha a transcrição e troque a voz. A fala muda e passa a soar como outra pessoa.
Same words, different voice, same model.
Voz A
Voz B
A clonagem zero-shot aceita um novo locutor
Um modelo de clonagem de voz zero-shot pode condicionar a fala TTS para que soe como uma pessoa fora do catálogo predefinido. Ele recebe uma transcrição e um trecho de áudio de referência como prompt.
Modelo de clonagem + transcrição + trecho de áudio do locutor = voz clonada
Como o áudio contém mais informações que o texto, esse prompt em áudio permite um controle mais preciso da voz sintetizada. Isso torna a técnica zero-shot, ou seja, o sistema pode lidar com uma pessoa cuja voz nunca foi usada em seu treinamento ou ajuste fino.
Durante a geração de voz, ele generaliza a partir do trecho de áudio de referência.
É assim que funciona a clonagem instantânea de voz, ou IVC, da Cartesia.
Você fornece um trecho curto da sua voz como prompt. Bastam 10 a 60 segundos de áudio para condicionar o modelo. O Sonic da Cartesia, um modelo TTS de ponta a ponta que também faz clonagem, extrai as características da sua voz dessa gravação e as usa para orientar a geração de fala que soa como você.
A clonagem profissional de voz, ou PVC, usa um conjunto maior de gravações para fazer ajuste fino do modelo. Isso vai além de condicioná-lo com uma amostra de voz durante a execução. O processo atualiza e adapta o próprio modelo às amostras. Ao contrário da IVC, a clonagem profissional leva mais tempo, até algumas horas. Observamos que os PVCs da Cartesia são tão fiéis que podem copiar partes indesejadas do áudio, como estalos de consoantes no microfone, artefatos do equipamento e ruído de fundo. Em muitos casos de uso, isso é até preferível!
Uma gravação contém mais que a identidade da voz
Clientes pedem vozes mais ásperas, mais acolhedoras ou mais confiantes. Um trecho de referência também contém ritmo, pausas, ruído do ambiente, sons da boca e detalhes daquela interpretação específica. O sistema precisa distinguir as características da pessoa das características da gravação.
Pausas longas podem afetar o ritmo gerado. O ruído de fundo pode ser reduzido, ignorado ou reproduzido. Dois modelos podem reagir de formas diferentes ao mesmo material.
As orientações de clonagem de voz da Cartesia recomendam áudio limpo, pausas curtas e uma interpretação original adequada ao caso de uso desejado.
Uma voz concentrada e ponderada é útil no atendimento ao cliente, mas pode parecer indiferente ou pouco empática em uma contestação de cobrança. Uma voz animada pode dar energia a uma apresentação de produto ou a um assistente de primeiros passos. Essas vozes têm características de fala diferentes, mas são geradas pelo mesmo modelo.
“Como escolher uma voz?” e “Este modelo TTS é bom?” são perguntas diferentes. Confundi-las significa investigar a causa errada quando a voz do seu agente soa estranha.
