블로그 / 제품

TTS 모델과 목소리는 다릅니다

Zubin Pratap 
TTS 모델과 목소리를 서로 다른 입력으로 보여주는 다이어그램

음성 합성 TTS 모델은 음성을 생성합니다. 하지만 모델과 그 모델이 사용하는 목소리는 다릅니다.

LLM에 익숙하다면 목소리를 시스템 프롬프트에 느슨하게 비유할 수 있습니다. 모델은 일반적인 역량을 제공하고 입력은 무엇을 생성할지 정합니다.

TTS에서 목소리는 모델과 별개인 입력인 경우가 많고 응답의 형태를 바꿉니다. 모델의 응답인 오디오는 텍스트보다 훨씬 복잡합니다. 음성을 생성하는 모델은 무엇을 말할지, 어떻게 말할지, 속도와 크기, 억양, 운율, 강조 등 여러 특성과 좋은 목소리의 기준을 알아야 합니다. 보통 이런 지시를 모델에 주고 싶지만 대부분의 TTS 모델은 전사 텍스트와 선택한 목소리라는 한두 가지 입력만 지정하게 합니다.

음성 모델의 입력

고정 화자 모델은 전사 텍스트 하나만 받습니다. 학습된 가중치에 담긴 한 목소리로 말하도록 학습되었으며 목소리를 입력으로 받지 않습니다.

따라서 어떤 텍스트를 넣어도 같은 화자처럼 들리는 오디오를 반환합니다.

고정 화자 모델 + 텍스트 = 하나의 목소리로 된 음성

모델에 포함된 한 목소리만 들을 수 있다면 모델과 목소리가 같은 것처럼 보입니다. 일반적인 사용에서 둘을 분리할 수 없습니다. 다른 화자를 만들려면 모델을 조정하거나 다시 학습해야 합니다.

반면 다중 화자 모델은 목소리 선택을 추가 입력으로 받습니다. 텍스트를 제공하고 모델이 지원하는 정해진 목록에서 목소리를 고릅니다.

다중 화자 모델 + 텍스트 + 선택한 화자 = 해당 목소리의 음성

합성 모델은 그대로이고 선택한 목소리가 생성되는 발화 특성을 바꿉니다.

텍스트를 고정하고 목소리만 바꾸면 다른 화자처럼 들립니다. 아래 녹음과 전사는 원래 영어를 유지합니다.

Same words, different voice, same model.

목소리 A

목소리 B

제로샷 복제는 새 화자를 받습니다

제로샷 음성 복제 모델은 미리 정해진 목록 밖의 화자처럼 TTS가 말하게 할 수 있습니다. 텍스트와 참조 화자의 오디오 클립을 프롬프트로 받습니다.

복제 모델 + 텍스트 + 화자 오디오 클립 = 복제 음성

오디오는 텍스트보다 많은 정보를 담으므로 오디오 클립 프롬프트로 합성 목소리를 세밀하게 제어할 수 있습니다. 학습이나 파인튜닝에서 보지 못한 화자도 다룰 수 있어 제로샷이라고 부릅니다.

음성을 생성할 때 참조 오디오에서 일반화합니다.

Cartesia의 Instant Voice Cloning, IVC가 이렇게 작동합니다.

자신의 목소리 클립을 프롬프트로 제공합니다. 모델에 조건을 주는 데 입력 오디오는 10~60초면 충분합니다. 복제도 처리하는 엔드투엔드 TTS 모델 Sonic은 녹음에서 목소리 특성을 추출해 모델에 전달하고 본인처럼 들리는 음성을 생성합니다.

Professional Voice Cloning, PVC는 더 큰 녹음 데이터셋으로 모델을 파인튜닝합니다. 실행 중 음성 샘플로 조건을 주는 데 그치지 않고 실제로 모델을 업데이트해 입력 샘플에 맞춥니다. IVC보다 오래 걸려 최대 몇 시간까지 필요합니다. 흥미롭게도 Cartesia PVC는 마이크의 파열음, 녹음 장비의 흔적, 배경 소음처럼 원치 않을 수도 있는 부분까지 복사할 정도로 잘 작동하는 것을 관찰했습니다. 많은 사용 사례에서는 오히려 이런 재현을 선호합니다.

녹음에는 정체성보다 많은 것이 담깁니다

고객은 “더 거친”, “더 따뜻한”, “더 자신 있는” 목소리를 요청합니다. 참조 클립에는 속도, 멈춤, 방의 소음, 입소리, 그때의 구체적인 표현도 담깁니다. 시스템은 어느 특성이 화자의 것이고 어느 것이 녹음에서 나온 것인지 구분해야 합니다.

긴 멈춤은 생성 속도에 영향을 줄 수 있습니다. 배경 소음은 줄이거나 무시하거나 재현할 수 있습니다. 같은 원본에도 두 모델은 다르게 반응할 수 있습니다.

Cartesia의 음성 복제 가이드는 깨끗한 오디오, 짧은 멈춤, 목표 사용 사례에 맞는 원본 표현을 권장합니다.

집중되고 차분한 목소리는 고객 지원에 유용하지만 청구 분쟁에서는 무심하거나 공감이 부족하게 들릴 수 있습니다. 밝은 목소리는 제품 안내나 온보딩 비서에 활기를 줍니다. 이 목소리들은 발화 특성이 다르지만 하나의 모델이 생성합니다.

“어떤 목소리를 고를까?”와 “이 TTS 모델은 좋은가?”는 별개 질문입니다. 혼동하면 음성 에이전트가 어색하게 들릴 때 잘못된 부분을 디버깅하게 됩니다.