학습 자료

최고의 음성 텍스트 변환 모델 비교 (2026)

Rene 
최고의 음성 텍스트 변환 모델 비교 (2026)

음성 텍스트 변환 모델을 비교하는 이유는 후속 처리에서 문제가 생겼기 때문일 것입니다. 에이전트가 날짜를 잘못 예약하거나, 전사 과정에서 전화번호가 뒤틀리거나, 배치 작업 비용이 그 작업을 사용하는 제품의 수익보다 커졌을 수 있습니다. 이 페이지는 2026년에 살펴볼 모델을 실제 맡길 작업에 따라 분류하고 각 모델의 한계를 설명합니다.

음성 에이전트를 위해 실시간 영어 오디오를 전사한다면 Ink 2가 가장 유력한 출발점입니다. 2026년 6월 기준 Artificial Analysis의 스트리밍 음성 텍스트 변환 순위에서 단어 오류율 1위를 기록했고, 별도 모델 없이 발화 차례를 감지합니다. 현재 다국어 스트리밍에서는 Deepgram Nova-3와 AssemblyAI의 Universal 모델이 더 많은 언어를 지원합니다. 직접 관리하는 하드웨어에서 녹음 파일을 전사한다면 OpenAI의 Whisper large-v3가 대표적인 오픈 소스 선택지입니다. 순위는 달라집니다. 이 페이지를 포함한 어느 한 페이지에만 의존하지 말고 최신 순위를 확인하세요.

스트리밍과 배치는 서로 다른 작업입니다

먼저 구분할 것은 공급업체가 아니라 작업의 종류입니다.

  • 스트리밍, 즉 실시간 전사는 화자가 아직 말하는 동안 텍스트를 반환합니다. 음성 에이전트, 실시간 자막, 통화 라우팅에 필요합니다. 모델은 일부만 들은 단어를 확정해야 하므로 정확도뿐 아니라 지연 시간과 화자가 생각을 마쳤는지 판단하는 능력도 평가해야 합니다.
  • 배치 전사는 완전한 녹음을 받아 전사문을 반환합니다. 팟캐스트 후반 작업, 회의록, 규정 준수 검토가 여기에 해당합니다. 지연 시간보다 정확도와 시간당 비용이 훨씬 중요합니다.

한 작업에 맞춰 만든 모델이 다른 작업에서도 뛰어난 경우는 드뭅니다. Whisper가 가장 분명한 예입니다. 오픈 모델로서 배치 정확도는 뛰어나지만 네이티브 스트리밍은 전혀 지원하지 않습니다. 여러 작업을 합친 하나의 순위만으로 제품을 선택하면 이 차이를 놓칩니다. 아래 비교를 작업별로 나눈 이유입니다.

음성 텍스트 변환 모델을 평가하는 방법

대부분의 실시간 구현에서는 다음 세 기준이 선택을 좌우합니다.

  1. 정확도, 특히 제품에 중요한 문자열의 정확도. 평균 단어 오류율(WER)은 실제로 피해를 주는 오류를 가립니다. 전체 WER가 준수한 모델도 확인 코드나 이메일 주소를 잘못 전사하거나 사용자가 말한 숫자를 조용히 누락할 수 있습니다. 바로 이런 오류가 에이전트의 예약 절차를 망가뜨립니다. 단어 오류율 가이드에서 이 문제를 더 자세히 다뤘습니다. WER는 기준 전사에 따라 달라지고 청자가 어떤 오류를 용인하는지 말해 주지 않으므로, 판정이 아니라 진단에 쓰는 지표입니다.
  2. 발화 차례 감지. 대화에서는 사용자가 언제 말을 멈췄는지 누군가 판단해야 합니다. 많은 시스템은 음성 활동 감지기와 무음 시간 제한을 덧붙입니다. 하지만 이 조합은 말 사이의 쉼에서 오작동하며, 파이프라인에 모델이 추가될 때마다 지연이 늘어납니다. 발화 차례 종료 예측을 내장한 모델은 이런 부가 장치를 없앱니다.
  3. 실제 환경에서의 지연 시간. 공급업체 페이지는 깨끗한 오디오에서 측정한 중앙값을 제시합니다. 실제 오디오에는 억양, 겹치는 말소리, 배경 소음이 있으며, 통화자가 겪는 것은 p95입니다. 실제 트래픽과 비슷한 녹음으로 최종 전사까지 걸리는 시간을 측정하세요.

가격은 네 번째 기준이며, 솔직한 답은 다소 단순합니다. 분당 요금 차이는 몇 분의 1센트 수준이고 자주 바뀌며, 고객의 말을 잘못 듣지 않는 모델을 고르는 것보다 중요하지 않습니다. 이 글을 읽는 시점의 최신 요금 페이지를 확인하세요.

비교할 만한 모델

2026년에 음성 텍스트 변환 후보를 추리는 개발자라면 다음 모델을 만나게 됩니다. 아래 주장은 각 공급업체의 자료 또는 독립 순위에서 가져왔으며, 그 출처를 구분해 표시했습니다.

음성 에이전트의 영어 스트리밍을 위한 Cartesia Ink 2

Ink 2는 실시간 에이전트용 스트리밍 모델이며, 저희가 개발하는 모델입니다. 출시 글과 2026년 6월 기준 단어 오류율 1위를 기록한 Artificial Analysis의 스트리밍 순위에 따르면 다음 강점이 있습니다.

  • 프로덕션 오디오의 정확도. 전화 회선 녹음, 다양한 억양, 시끄러운 환경, 실적 발표 통화에서 테스트했으며, 해당 테스트에서 Deepgram Flux, Soniox RT-V4, AssemblyAI의 실시간 모델, ElevenLabs Scribe-2-realtime을 앞섰습니다. 전화번호, 이메일, UUID, 날짜 같은 구조화된 개체는 전체 시퀀스가 끝날 때까지 기다린 뒤 확정합니다.
  • 내장된 발화 차례 감지. 발화 차례 종료 예측이 모델에 포함되어 있어 Silero나 별도의 차례 관리 서비스를 실행할 필요가 없습니다. Pipecat 파이프라인에서 Ink의 빠른 발화 종료 예측은 사용자의 발화 차례가 공식적으로 끝나기 전에 에이전트가 응답을 시작하도록 해 응답 시간을 약 0.5초 줄였습니다.
  • 전처리 필터 없이 소음에 대응. Krisp와 같은 단계를 시스템에서 없애고 그 비용과 지연도 줄입니다.

한계도 분명합니다. 현재 Ink 2는 영어만 전사하며, 다국어 모델은 프리뷰 단계입니다. 지금 스페인어나 힌디어 통화를 처리해야 한다면 아래 다국어 옵션을 선택하고 나중에 다시 검토하세요. Cartesia는 클라우드, 온프레미스, 망분리 배포를 제공하며, 플레이그라운드에서 Ink를 무료로 체험할 수 있습니다.

오픈 소스 배치 전사의 기준인 OpenAI Whisper large-v3

Whisper는 자체 GPU에서 배치 전사를 할 때 비교 기준이 되는 모델입니다. 공개 가중치, 약 99개 언어, 깨끗한 오디오에서 준수한 정확도를 제공하며 특정 공급업체에 종속되지 않습니다. 개인정보 보호나 비용에 민감한 작업을 위해 직접 호스팅하는 팀이 많습니다.

한계는 바로 이 페이지 제목에 해당하는 작업에서 드러납니다. Whisper는 배치 전용입니다. 네이티브 스트리밍도, 발화 차례 감지도 없으며, 무음이나 음성이 아닌 오디오에서 문구를 만들어 내는 문제가 알려져 있습니다. AssemblyAI의 설명에서도 이 문제를 약점으로 지적하며, Whisper 위에 얹는 모든 스트리밍 래퍼가 이를 그대로 물려받습니다. 청크 단위 스트리밍 구성은 약 500밀리초의 지연을 추가하고 발화 종료 감지도 직접 해결해야 합니다. Whisper는 파일에 사용하세요. 실시간 에이전트의 귀로 사용하지는 마세요.

대규모 다국어 스트리밍을 위한 Deepgram Nova-3

Deepgram의 Nova-3는 다국어 배포에 널리 쓰이는 스트리밍 API입니다. 공급업체 발표 기준 300밀리초 미만의 스트리밍 지연, 10개 언어 사이의 실시간 전환, 도메인 맞춤화를 제공합니다. Nova-3 출시 글은 스트리밍 오디오에서 WER 중앙값 6.84%를 보고합니다. 이는 공급업체 수치이며, 독립 지표에서는 더 높게 나옵니다. 공급업체 수치는 직접 재현하기 전까지 마케팅 자료로 읽어야 한다는 점을 상기시킵니다. Deepgram은 음성 에이전트용 발화 차례 종료 감지를 추가한 Flux도 제공합니다. 기존 STT만으로는 발화 차례 처리를 해결할 수 없다는 뜻입니다.

현재 프로덕션에서 많은 언어가 필요하고 별도 발화 차례 감지 계층이나 Flux를 함께 사용할 수 있다면 Nova-3를 선택하세요.

스트리밍과 음성 분석을 함께 제공하는 AssemblyAI Universal

AssemblyAI의 Universal 제품군은 스트리밍 전사에 요약, 개체 감지, 감정 분석, 개인정보 마스킹을 하나의 API로 결합합니다. 실시간 모델은 음성 에이전트 벤치마크에서도 직접 경쟁합니다. 회사 자체 자료에 따르면 영어 음성 에이전트 벤치마크에서 Universal-3.6 Pro Realtime의 WER는 5.19%로, 같은 테스트의 Scribe v2와 Nova-3를 앞섰습니다. 공급업체가 직접 수행한 벤치마크로 받아들여야 하지만, 방향은 명확합니다. 하나의 공급업체에서 전사와 오디오 분석을 함께 제공합니다. 전사문을 에이전트뿐 아니라 분석에도 활용한다면 좋은 선택입니다.

이미 Google Cloud를 사용하는 팀을 위한 Google Chirp 3

Google의 Chirp 3는 폭넓은 언어 지원과 많은 팀이 이미 쓰는 클라우드 공급업체를 유지하는 운영상의 단순함을 제공합니다. 영어 스트리밍의 독립 정확도 순위에서 선두에 오르는 경우는 드물지만, 기존 계약, 규정 준수 요건, 단일 청구서 같은 구매 현실 때문에 실제 배포에서 계속 사용됩니다.

Ink와 Whisper, 오픈 소스 기본 선택지가 불리한 경우

가장 자주 보는 비교는 Cartesia Ink와 OpenAI Whisper이므로 별도로 답할 가치가 있습니다. 겉으로는 “어느 모델이 더 좋은가”라는 질문이지만, 실제 질문은 “어떤 작업을 해야 하는가”입니다.

파일, 여러 언어, 자체 GPU가 있다면 Whisper가 유리합니다. 녹음된 통화, 팟캐스트, 보관 자료를 저렴하게 대규모 배치 전사하고 공급업체에 분당 요금을 내지 않아도 됩니다.

실시간 대화라면 Ink가 유리합니다. 사용자가 말하는 동안 스트리밍하고, 단어를 더 빠르게 확정하며, 별도의 종료 감지 모델 없이 발화 차례의 끝을 예측합니다. 숫자, 식별자, 다양한 억양에서도 정확도를 유지합니다. 이런 오류는 잘못된 예약으로 이어집니다. Whisper에 스트리밍 래퍼를 붙이면 청크 분할, 발화 종료 감지, 무음 중 환각을 직접 처리해야 하고, 그 비용을 왕복 지연으로 치르게 됩니다.

선택이 어려울 때 쓸 수 있는 기준이 있습니다. 파이프라인에 이미 Silero, Krisp, 재시도로 이어 붙인 무음 시간 제한 상태 머신이 들어 있다면, 그 장치들은 배치 모델을 스트리밍 작업에 쓰기 위한 보완책입니다. 처음부터 스트리밍용으로 만든 모델은 이를 대체합니다.

어떤 음성 텍스트 변환 모델을 선택해야 할까요?

작업에 맞게 모델을 선택하세요.

작업시작할 모델
실시간 영어 음성 에이전트Ink 2
실시간 다국어 전사Deepgram Nova-3, AssemblyAI Universal realtime
자체 호스팅 배치 파일 처리Whisper large-v3
하나의 API에서 전사와 분석AssemblyAI Universal
기존 클라우드 계약 유지Google Chirp 3

결정하기 전에 자체 오디오로 테스트하세요. 이 페이지의 모든 수치는 다른 사람의 녹음에서 나왔습니다. 중요한 순위는 실제 트래픽으로 얻은 순위입니다. 다양한 억양, 겹치는 말소리, 확인 코드를 한 글자씩 읽는 통화자처럼 가장 까다로운 통화 몇 개를 최종 후보 두세 개에 입력해 보세요. 제품이 감당할 수 없는 오류까지 포함해 결과를 비교하세요.

영어 음성 에이전트가 목적이라면 별도 설정 없이 플레이그라운드에서 Ink 2를 체험하거나, 음성 에이전트 구축 방법을 읽고 전체 파이프라인에서 전사가 맡는 역할을 확인하세요.

관련 문서

자주 묻는 질문

최고의 음성 텍스트 변환 모델은 무엇인가요?

작업에 따라 다릅니다. 음성 에이전트의 영어 스트리밍에서는 Ink 2가 2026년 6월 기준 Artificial Analysis 스트리밍 순위에서 단어 오류율 1위를 기록했고, 발화 차례 감지 기능도 내장하고 있습니다. 다국어 스트리밍에서는 현재 Deepgram Nova-3와 AssemblyAI의 Universal 모델이 더 많은 언어를 지원합니다. 자체 하드웨어에서 배치 전사를 한다면 Whisper large-v3가 대표적인 오픈 소스 선택지입니다. 이 페이지를 포함한 어느 한 페이지에만 의존하지 말고 최신 순위를 확인하세요.

Whisper는 실시간으로 전사할 수 있나요?

기본적으로는 지원하지 않습니다. Whisper는 완전한 오디오 구간을 받은 뒤 텍스트를 반환하는 배치 모델입니다. 개발팀은 오디오를 청크로 나누고 발화 종료 시점을 직접 처리하는 스트리밍 래퍼를 만들지만, 지연과 오류 가능성이 늘어납니다. 실시간 전사가 필요하다면 Cartesia Ink, Deepgram Nova-3, AssemblyAI의 실시간 모델처럼 처음부터 스트리밍용으로 설계된 모델이 더 간단한 방법입니다.

단어 오류율이란 무엇이며, WER가 낮으면 항상 더 좋은가요?

단어 오류율(WER)은 기준 전사와 비교했을 때 모델이 잘못 전사한 단어의 비율입니다. 유용한 진단 지표이지만 완전한 판정 기준은 아닙니다. 서식 선택에도 오류를 부과하고, 기준을 평가한 ASR 모델에 따라 달라지며, 같은 WER를 가진 두 구현도 한쪽이 숫자와 식별자를 빠뜨린다면 체감 품질이 크게 다를 수 있습니다. 자체 오디오로 평가하고 애플리케이션이 허용할 수 없는 오류에 더 큰 가중치를 두세요.

숫자와 식별자를 가장 잘 처리하는 음성 텍스트 변환 모델은 무엇인가요?

평균 WER뿐 아니라 개체 단위 평가를 확인하세요. 전화번호, 이메일 주소, 영숫자 조합, 날짜는 일반 단어와 다른 방식으로 오류가 발생하며, 일부 모델은 시퀀스 중간의 개체를 더 잘 처리합니다. 예를 들어 Ink 2는 전체 시퀀스가 끝날 때까지 기다린 뒤 확정합니다. 어떤 모델을 선택하든 주문 번호, 확인 코드, 주소처럼 제품이 실제로 듣는 문자열로 테스트하세요.

Ink 2의 요금은 얼마인가요?

Ink 2는 오디오 분 단위로 요금이 부과되며, 사용량 할인과 기업 계약의 맞춤 요금이 제공됩니다. 현재 요금은 Cartesia 요금 페이지에서 확인할 수 있으며, Cartesia 플레이그라운드에서 모델을 무료로 테스트할 수 있습니다.