오늘 실시간 음성 애플리케이션 개발자를 위한 새 스트리밍 음성 인식, STT 모델군 Ink를 소개합니다. 첫 모델 Ink-Whisper는 OpenAI Whisper를 대화 환경의 저지연 전사에 맞게 최적화한 변형입니다. 오늘부터 사용할 수 있는 Ink-Whisper는 엔터프라이즈급 음성 에이전트를 위해 설계한 가장 빠르고 저렴한 STT 모델입니다.
Sonic에서 Ink로: 음성 출력에서 음성 입력까지
Sonic을 통해 Cartesia는 속도, 품질, 안정성을 중시하는 개발자들이 선호하는 음성 합성, TTS 제공업체가 되었습니다. Sonic의 초저지연 분야 시장 선도력이 고객에게 사실적인 상호작용형 음성 경험을 제공하도록 돕는다는 점을 생각하면 자연스러운 결과입니다. 이제 Ink로 대화의 다른 쪽인 STT에 집중합니다.
실시간에 맞게 Whisper 다시 설계하기
STT 출시를 준비하면서 개발자들이 이미 무엇을 쓰고 어떤 문제가 있는지 살폈습니다. 그 결과 OpenAI의 whisper-large-v3-turbo에 주목했습니다. 널리 쓰이는 이유가 있습니다. Whisper는 대화 전사의 정확도에서 다른 비공개 음성 인식 제공업체와 비슷한 성능을 내며, 오픈소스이고 효율적으로 추론할 수 있습니다.
Whisper 관련 개선은 대부분 처리량, 즉 큰 데이터셋을 얼마나 빨리 전사하는지에 집중했습니다. 실시간 계수, RTF로 측정하는 값입니다. 긴 오디오 파일의 후처리에는 좋지만 실시간 음성 에이전트에서는 표준 Whisper의 속도와 정확도가 부족합니다. 전사 품질은 전체 평균뿐 아니라 모든 통화에서 높아야 합니다. 표준 Whisper는 실제 환경의 어려운 조건을 위해 설계되지도 않았습니다.
Whisper는 근본적으로 대량 처리를 위해 만들어졌고 실시간 대화용은 아니었습니다. 그래서 속도와 현실의 맥락을 중심에 두고 실시간 음성 AI에 맞춰 Ink-Whisper로 다시 설계했습니다.
실제 대화를 위해 만든 Ink-Whisper
기업용 음성 AI 에이전트는 말하는 순간 전사하면서도 다양한 실제 환경에서 안정적으로 작동해야 합니다. Ink-Whisper는 일반 음성 인식 시스템이 어려워하는 다음 조건의 정확도에 집중했습니다.
- 전화 통화의 왜곡: 낮은 대역폭과 압축된 오디오는 왜곡을 더합니다.
- 고유명사와 분야별 용어: 제품, 약품, 금융 상품의 이름을 명확히 인식해야 합니다.
- 배경 소음: 교통 소리, 식당의 대화, 아기 울음, 잡음은 정확한 전사를 어렵게 합니다.
- 비유창성과 침묵: “um” 같은 말버릇과 멈춤은 표준 Whisper 구현을 혼란스럽게 합니다.
- 억양과 다양성: 목소리는 다양하며 STT 모델은 이에 적응해야 합니다.
표준 Whisper 대비 핵심 개선 중 하나는 동적 청킹입니다. 표준 Whisper는 30초 전체 청크에서 가장 잘 작동합니다. 하지만 대화형 AI는 훨씬 짧고 조각난 오디오를 다룹니다. 의미 있는 지점에서 끝나는 가변 길이 청크를 처리하도록 Whisper를 바꿨습니다. 특히 침묵이나 오디오 공백에서 오류와 환각이 줄어듭니다.
Ink-Whisper가 실제 환경에서 더 잘 작동하는지 확인하기 위해 음성 AI의 흔한 과제를 반영한 평가 데이터셋을 만들었습니다.
- 배경 소음 데이터셋: 교통, 카페, 사무실 등 시끄러운 환경에서 녹음한 대화
- 고유명사 데이터셋: 금융 용어와 브랜드명이 밀집된 SPGISpeech 샘플 100개
- 발화 억양 데이터셋: 다양한 영어 억양의 전사로 인구 집단 전반의 안정성을 평가
이 데이터셋들에서 Ink-Whisper는 단어 오류율, WER 기준으로 기본 whisper-large-v3-turbo보다 정확합니다. 다른 스트리밍 음성 인식 모델과 비교해도 경쟁력 있는 WER을 보이며, 프로덕션급 실시간 성능에 최적화되어 있습니다.
| 관련 데이터셋의 단어 오류율 | 데이터셋 설명 | Cartesia Streaming whisper-natural | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | Assembly Streaming |
|---|---|---|---|---|---|
| 전화 통화 | 자연스러운 전화 대화 | 0.19 | 0.18 | 0.28 | 0.23 |
| 고유명사 | 전문 용어가 많은 발화 | 0.065 | 0.045 | 0.071 | 0.044 |
| 배경 소음 | 배경 소음 | 0.033 | 0.038 | 0.099 | 0.027 |
| 비유창성 | 말버릇과 잡음 | 0.064 | 0.055 | 0.156 | 0.137 |
| Speech Accent Archive 부분집합 | 다양한 억양 | 0.015 | 0.024 | 0.014 | 0.016 |
가장 빠른 스트리밍 모델 Ink-Whisper
사실적인 대화를 위해서는 정확도뿐 아니라 스트리밍 전사의 속도도 중요합니다. Ink-Whisper에서는 완전한 전사까지 걸리는 시간, TTCT라는 지표를 강조합니다. 사용자가 말을 멈춘 뒤 전체 전사가 준비될 때까지의 시간입니다. TTCT는 주의 깊게 듣는 사람처럼 전체 시스템이 얼마나 빨리 응답할지 결정합니다.
부자연스러운 봇을 바로 알아차리게 하는 것은 응답의 지연입니다. 이런 지연은 자연스러운 대화의 리듬을 끊고 통화 중단, 사용자 불만, 매출 손실로 이어집니다. TTCT를 최소화하는 것은 속도의 문제이면서 상호작용을 사람답게 느끼게 하는 문제입니다.
Ink-Whisper는 TTCT에서도 기본 whisper-large-v3-turbo를 앞섭니다. 실제로 우리가 테스트한 모든 스트리밍 음성 인식 모델 중 가장 빠른 TTCT를 제공합니다.
| 마지막 오디오 전송 후 전사 완료 시간 | Cartesia Streaming Ink-Whisper | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | AssemblyAI Universal Streaming |
|---|---|---|---|---|
| 중앙값 (ms) | 66 | 74 | 70 | 737 |
| P90 (ms) | 98 | 109 | 189 | 829 |
표준 Whisper는 여전히 가장 범용적인 공개 STT 모델 중 하나지만 실시간용은 아니었습니다. Ink-Whisper는 대화 정확도와 초저지연에 맞춘 최적화로 이를 바꿉니다. 우리가 확인한 가장 빠른 TTCT를 제공하며, 소음이 있거나 다양한 억양과 변화가 있는 발화에서도 좋은 성능을 냅니다. 통제된 실험실이나 스튜디오가 아니라 음성 에이전트가 마주하는 실제 조건에서 평가했습니다.
가장 저렴한 스트리밍 모델 Ink-Whisper
우리는 음성이 미래라고 믿으며, 음성 솔루션 개발자가 Ink-Whisper를 쉽게 사용할 수 있도록 합니다. Ink-Whisper는 현재 제공되는 가장 빠르고 저렴한 스트리밍 STT 모델입니다. 초당 1크레딧, Scale 플랜 기준 $0.13/hr로 높은 수준의 실시간 전사를 가장 낮은 가격에 제공합니다.
다음과 같이 Ink-Whisper를 시작할 수 있습니다.
- Vapi, Pipecat, LiveKit과 쉽게 연결되어 몇 분 안에 음성 상호작용을 스트리밍할 수 있습니다.
- 가동률 99.9%와 SOC 2 Type II, HIPAA, PCI 등 엔터프라이즈급 규정 준수를 갖춰 규모에 맞게 배포할 수 있습니다.
Cartesia와 음성 AI의 미래
음성 에이전트에 대한 수요가 급증하고 있습니다. 가장 효과적인 에이전트는 Sonic 음성 합성 모델 같은 최신 오디오 AI를 사용합니다. 이제 Ink-Whisper로 대화의 다른 쪽에서도 수요에 대응하며 빠르고 자연스러운 대화를 지원합니다. 오늘의 출시는 실시간 음성 스택을 어떻게 다시 설계하고 있는지 보여주는 시작입니다. 앞으로 더 공유하겠습니다.
