뉴럴 TTS란? 뉴럴 음성이 작동하는 방식

Rene, Kabir Goel 
뉴럴 TTS란? 뉴럴 음성이 작동하는 방식

뉴럴 음성 합성(뉴럴 TTS)은 몇 시간 분량의 사람 목소리로 학습한 신경망이 오디오를 생성하는 음성 합성 방식입니다. 그 전에는 컴퓨터가 녹음된 음성 조각을 이어 붙이거나, 사람이 작성한 규칙으로 목소리를 계산했습니다. 뉴럴 TTS는 발음, 리듬, 억양을 데이터에서 배웁니다. 그래서 “경로를 재탐색합니다”라고 말하는 내비게이션이 아니라 사람처럼 들립니다.

설정 메뉴나 클라우드 콘솔에서 ‘뉴럴’ 음성을 권해서 여기에 오셨다면, 그걸 고르세요. 훨씬 자연스럽게 들립니다. 클라우드 청구서에서는 보통 표준 음성의 약 4배 가격이며, 아래 요금 섹션에서 다룹니다.

제품에 쓸 음성 모델을 고르고 있다면, 2026년에 던져야 할 질문은 어떤 뉴럴 TTS를 쓸지입니다. 비교하게 될 음성은 거의 모두 뉴럴입니다. 차이는 오디오를 생성하는 방식, 말을 시작하는 속도, 그리고 제품이 실제로 보내는 텍스트를 다루는 방식에 있습니다.

뉴럴 TTS 이전의 방식

대부분의 클라우드 플랫폼에서 ‘표준’ 음성은 여전히 두 가지 오래된 방식으로 만들어집니다.

연결 합성(concatenative synthesis)은 실제 화자의 녹음을 작은 단위로 자른 뒤 다시 이어 붙입니다. Amazon Polly 문서는 표준 엔진을 “녹음된 음성의 음소를 연결한다”고 설명하며, 단위 사이의 이음새가 자연스러움의 한계가 됩니다.

파라메트릭 합성은 재생할 때 녹음을 쓰지 않습니다. 모델이 음향 파라미터를 예측하고 신호 처리 보코더가 이를 소리로 바꿉니다. Google Cloud의 음성 유형 페이지에 따르면 표준 음성 상당수가 이 방식의 변형을 씁니다. 유연하고 가볍지만, 옛날 TTS 하면 떠오르는 약간 웅웅거리는 로봇 같은 소리의 원인이기도 합니다.

뉴럴 TTS의 작동 방식

일반적인 뉴럴 TTS 시스템은 세 단계로 이루어집니다.

  1. 텍스트 전처리 단계가 입력을 정규화합니다. “Dr. Lee, 221B Baker St., $4.50”은 화자가 실제로 읽을 단어로 바뀌어야 하고, 모델은 약어와 숫자를 문맥에 맞게 어떻게 읽을지 알아야 합니다.
  2. 음향 모델이 음성이 어떻게 들려야 하는지 예측합니다. 보통 멜 스펙트로그램, 즉 시간에 따라 주파수별 에너지가 어떻게 분포하는지 보여 주는 이미지로 출력합니다. 타이밍, 강세, 음높이가 여기서 정해집니다.
  3. 뉴럴 보코더가 그 스펙트로그램을 재생 가능한 파형으로 바꿉니다.

업체들이 아직도 제품 이름에 쓰고 있으니 주요 이정표를 알아 두면 좋습니다. DeepMind의 WaveNet(2016)은 오디오를 샘플 하나씩 생성했고, 당시 최고의 파라메트릭·연결 합성 시스템보다 더 자연스럽다는 평가를 받았습니다. Google의 Tacotron 2(2017)는 스펙트로그램 예측기와 WaveNet 보코더를 결합해 평균 의견 점수 4.53을 기록했습니다(전문 녹음은 4.58). HiFi-GAN(2020)은 고품질 보코딩을 저렴하게 돌릴 수 있을 만큼 빠르게 만들었습니다. Amazon의 뉴럴 엔진도 스펙트로그램을 출력하는 시퀀스-투-시퀀스 네트워크와 뉴럴 보코더라는 같은 2단 구조를 따릅니다.

새로운 세대: 음성을 토큰으로

2023년 무렵부터 많은 시스템이 스펙트로그램을 쓰지 않습니다. Meta의 EnCodec 같은 뉴럴 오디오 코덱이 오디오를 이산 토큰의 흐름으로 압축합니다. 모델은 언어 모델이 단어를 예측하듯 그 토큰을 예측하고, 코덱이 이를 다시 소리로 바꿉니다. Microsoft의 VALL-E가 그 효과를 보여 줬습니다. 6만 시간 분량의 영어로 학습해, 3초짜리 녹음만으로 새로운 화자의 목소리를 흉내 낼 수 있었습니다.

클라우드 업체들이 지금 ‘생성형(Generative)’ 또는 ‘HD’ 음성으로 파는 것이 바로 이것입니다. Amazon은 생성형 엔진을 텍스트를 음성 코드로 바꾸는 10억 파라미터 트랜스포머와, 이를 오디오로 스트리밍하는 디코더의 조합으로 설명합니다. 이런 모델은 의도에 맞는 톤으로 읽고, 적절한 순간에 웃고, 대화처럼 들리는 데 더 뛰어납니다. 대신 대가가 있습니다. Microsoft는 HD 음성이 출력할 때마다 조금씩 달라진다고 하고, Amazon은 모델 업데이트로 목소리가 달라질 수 있다고 경고합니다. 팟캐스트 한 시즌을 만든다면 중요한 문제입니다. 전화 응대라면 대부분 상관없습니다.

상태 공간 모델의 자리

실시간 음성 생성은 긴 시퀀스 문제입니다. 몇 초짜리 오디오도 수천 단계입니다. 트랜스포머의 어텐션은 지금까지 생성한 모든 것을 다시 보기 때문에, 오디오가 길어질수록 단계마다 비용이 커집니다. 상태 공간 모델은 과거를 고정된 크기의 요약으로 들고 가기 때문에 단계마다 비용이 같습니다.

Cartesia 창업자들은 Cartesia가 생기기 전부터 이 아이디어를 연구했습니다. Albert Gu와 Karan Goel은 S4의 공동 저자이고, Gu는 Tri Dao와 함께 Mamba의 공동 저자입니다. Cartesia의 TTS 모델 Sonic은 이 아키텍처 계열을 기반으로 합니다. 90ms 미만의 모델 지연 시간으로 생성하면서 오디오를 스트리밍하고, 44개 언어를 말하며, Sonic 3.6은 2026년 8월 출시 당시 Artificial Analysis의 두 음성 합성 리더보드에서 모두 1위를 차지했습니다. 저희는 통화 상대가 1밀리초의 지연까지 느끼는 음성 에이전트를 위해 Sonic을 만들었습니다.

요금 페이지에서 ‘뉴럴’이 뜻하는 것

클라우드 업체들은 이 단어를 요금 등급으로 씁니다. 2026년 10월 3일 기준 Amazon과 Google의 요금(100만 자당)은 다음과 같습니다.

제공업체기존 음성뉴럴최신 등급
Amazon PollyStandard: 4달러Neural: 16달러Generative: 30달러, Long-Form: 100달러
Google CloudStandard: 4달러Neural2: 16달러Chirp 3: HD: 30달러

눈에 띄는 점이 두 가지 있습니다. 첫째, 이름이 업체마다 맞지 않으니 라벨이 아니라 아키텍처와 실제로 들어 본 결과로 비교하세요. Google은 2016년 뉴럴의 돌파구였던 WaveNet 음성을 이제 표준 음성과 같은 4달러에 제공합니다. 둘째, 최신 등급은 뉴럴 등급의 약 두 배입니다. 그만한 가치가 있는지는 여러분의 텍스트와 청취자에 달려 있고, 테스트해 봐야만 알 수 있습니다.

뉴럴 음성이 좋은지 판단하는 법

모든 업체가 자기 음성이 사람처럼 들린다고 말합니다. 쓸모 있는 테스트는 여러분의 제품과 닮은 테스트입니다.

  • 사용자가 실제로 듣게 될 문자열을 보내 보세요. 주문 번호, 이메일 주소, 날짜, 가격, 이름 같은 것입니다. 뉴럴 모델은 이런 문자열에서 일반 문장과는 다른 방식으로 실수합니다.
  • 맥락 속에서 들어 보세요. 따로 들으면 좋은 문장도 사과 뒤에 오면 어울리지 않는 톤일 수 있습니다.
  • 사용자가 경험하는 경로로 측정하세요. 실시간 대화라면 완성된 파일의 생성 시간이 아니라, 스트리밍 연결에서 첫 오디오가 도착하기까지의 시간입니다.
  • 긴 글과 출시할 모든 언어로 테스트하세요. 짧은 데모에서는 보이지 않는 방식으로 속도가 흐트러지고 억양이 섞입니다.

이 주제에 대해 저희 연구팀이 더 긴 글 Is this TTS model good?을 썼습니다. 하나의 점수로 결론이 나지 않는 이유를 설명합니다.

오픈소스 뉴럴 TTS

뉴럴 TTS는 자체 하드웨어에서 무료로 실행할 수도 있습니다. Piper는 홈 오토메이션에서 많이 쓰는 빠른 로컬 엔진입니다. Kokoro는 Apache 라이선스의 8,200만 파라미터 모델입니다. 둘 다 네트워크에 연결되지 않은 기기에서 텍스트를 소리 내어 읽는 용도에 잘 맞습니다. 다만 콜센터 규모의 저지연 스트리밍용으로 만들어지지는 않았습니다. 그건 Sonic이 하는 일입니다.

차이를 직접 들어 보려면 제품에서 실제로 말하는 문장을 Cartesia 플레이그라운드에 붙여 넣어 보세요. 무료 플랜에는 여러분의 텍스트로 시험해 보기에 충분한 크레딧이 포함되어 있습니다.

자주 묻는 질문

뉴럴 TTS란 무엇인가요?

뉴럴 음성 합성(뉴럴 TTS)은 사람이 말하는 녹음으로 학습한 신경망이 오디오를 생성하는 음성 합성 방식입니다. 이전 시스템은 녹음된 음성 조각을 이어 붙이거나 사람이 설계한 신호 처리를 사용했습니다. 뉴럴 TTS는 발음, 리듬, 억양을 데이터에서 배우기 때문에 훨씬 사람에 가깝게 들립니다.

뉴럴 음성과 표준 음성은 무엇이 다른가요?

클라우드 서비스에서 '표준(Standard)'은 보통 예전의 연결 합성 또는 파라메트릭 음성을, '뉴럴'은 신경망이 생성하는 음성을 뜻합니다. 예를 들어 Amazon Polly 문서는 표준 음성이 녹음된 음소를 연결하고, 뉴럴 엔진은 신경망으로 스펙트로그램을 예측한 뒤 뉴럴 보코더로 오디오로 바꾼다고 설명합니다. 뉴럴 음성이 더 자연스럽고 더 비쌉니다. 2026년 10월 3일 기준 Polly는 표준 음성이 100만 자당 4달러, 뉴럴 음성이 16달러였습니다.

뉴럴 TTS와 AI 음성은 같은 건가요?

사실상 같습니다. 요즘 AI 음성 생성기는 모두 뉴럴 TTS 모델입니다. 생성형(Generative) 음성이라고 불리는 최신 시스템도 신경망이며, 스펙트로그램 대신 언어 모델이 단어를 예측하듯 압축된 오디오 토큰을 예측할 뿐입니다.

뉴럴 TTS는 실시간으로 작동할 수 있나요?

모델이 스트리밍을 지원하면 가능합니다. 스트리밍 모델은 문장 생성을 끝내기 전에 오디오를 보내기 시작하므로 거의 바로 재생을 시작할 수 있습니다. 예를 들어 Cartesia의 Sonic은 모델 지연 시간이 90ms 미만이고 생성하면서 오디오를 스트리밍합니다. 전화 음성 에이전트에 필요한 것이 바로 이것입니다.

뉴럴 TTS는 얼마인가요?

제공업체와 등급에 따라 다릅니다. 2026년 10월 3일 기준 Amazon Polly는 뉴럴 음성이 100만 자당 16달러, 생성형 음성이 30달러였고, Google Cloud는 Neural2가 100만 자당 16달러, Chirp 3 HD가 30달러였습니다. Piper와 Kokoro 같은 오픈소스 모델은 자체 하드웨어에서 무료로 실행할 수 있습니다. Cartesia의 요금은 요금 페이지에 있으며 무료 플랜으로 시작할 수 있습니다.