실시간 음성 에이전트를 위한 음성 인식 모델 Ink-2를 출시합니다.
2026년 6월 기준 가장 낮은 단어 오류율로 Artificial Analysis 스트리밍 리더보드 1위입니다. 제공업체 중 가장 정확한 내장 발화 종료 감지로 언제 듣고 언제 응답할지 판단합니다.
단어 오류율: 데이터셋별 최종 전사
발화 종료 감지 후 최종 전사에서 잘못 전사한 단어의 비율. 낮을수록 좋습니다.
음성 에이전트의 STT는 정확도, 발화 종료 감지, 지연 시간 세 가지를 제대로 처리해야 합니다. 하나만 부족해도 경험이 무너집니다. 사용자를 잘못 이해하거나, 엉뚱한 시점에 끼어들거나, 늦게 응답하거나, 대화가 부자연스러워집니다. Ink-2는 세 영역 모두에서 앞서도록 만들었습니다.
정확도: 모든 단어를 올바르게
전화번호, 이메일 주소, 영숫자, 날짜 같은 구조화된 개체 인식을 많이 개선했습니다. Ink-2는 개체 중간임을 이해하고 특별한 프롬프트 없이도 전체 순서가 끝날 때까지 확정을 기다립니다.
실제 음성 에이전트 통화를 반영해 다양한 억양에서 안정적으로 작동하도록 만들었습니다. 실제 콜센터 대화의 영어 억양 14개를 포함한 AppTek에서 Ink-2는 WER 8%로 가장 뛰어난 스트리밍 STT입니다. Deepgram Flux는 10%, ElevenLabs Scribe v2는 12%입니다.
단어 오류율 (WER): AppTek
실제 콜센터 대화의 영어 억양 14개에서 WER을 측정한 벤치마크. 낮을수록 좋습니다.
깨끗한 기준 오디오뿐 아니라 프로덕션 조건에서도 정확도를 유지합니다. 내부 벤치마크는 비영어권 화자, 배경 소음, 나쁜 네트워크로 손상된 오디오를 포함해 실제 음성 에이전트 통화에서 직접 샘플링했습니다. Ink-2의 WER은 6.5%이며 ElevenLabs Scribe v2는 9.2%, Deepgram Flux는 9.4%입니다.
단어 오류율 (WER): 프로덕션 음성 에이전트
프로덕션 조건에서 녹음한 자체 음성 에이전트의 실제 통화 36건으로 구성한 내부 벤치마크. 낮을수록 좋습니다.
실제 음성 에이전트의 정확도는 깨끗한 벤치마크뿐 아니라 구조화된 개체와 프로덕션 오디오에서 시험받습니다. 예시의 녹음과 전사는 원래 언어를 유지합니다.
ink-2
완전하고 형식이 지정된 번호
열 자리 숫자를 모두 전사하고 전화번호 형식으로 표시합니다.
flux-general-en
마지막 숫자 누락
숫자를 글자로 풀어 쓰면서 마지막 숫자를 누락합니다.
발화 종료 감지: 언제 듣고 응답할지 알기
정확도는 벤치마크에서 분명히 보이지만, 대부분의 에이전트가 프로덕션에서 어려움을 겪는 부분은 발화 종료 감지입니다.
대부분은 침묵을 기준으로 차례가 끝났다고 판단합니다. 충분히 오래 멈추면 발화를 갑자기 끝냅니다. 테스트에서는 괜찮지만 실제 통화에서는 고객이 주소를 말하는 중간이나 “제 이메일은…” 직후에 끼어들게 됩니다.
Ink-2에는 의미 기반 엔드포인팅을 내장했습니다. 침묵 대신 의미를 읽어 발화가 끝났는지 판단합니다. 아직 주소를 말하는 중인지, 이어지는 생각이 멈출 지점이 아닌지 압니다. 화자가 끝났다고 확신할 때까지 발화를 열어둡니다.
Ink-2는 외부 VAD 없이 세 이벤트를 기본으로 내보냅니다.
turn.start: 사용자가 말하기 시작했습니다.turn.eager_end: 모델이 발화가 곧 끝날 것으로 예측해 LLM이 미리 생성을 시작할 수 있습니다.turn.end: 발화 완료를 확인했습니다.
ink-2
발화 횟수: 1
전체 구간을 하나의 발화로 유지
flux-general-en
발화 횟수: 2
하나의 구간을 여러 발화로 분리
scribe_v2_realtime
발화 횟수: 3
하나의 구간을 여러 발화로 분리
사람이 라벨링한 기준으로 발화 종료 감지를 측정합니다. 정밀도는 모델이 끝났다고 판단했을 때 맞는 비율이며, 낮으면 말을 끊습니다. 재현율은 실제 종료를 잡는 비율이며, 낮으면 계속 듣느라 어색한 침묵이 생깁니다. F1은 둘을 하나의 점수로 균형 있게 나타냅니다.
다른 모델은 둘 중 하나를 위해 다른 하나를 희생하지만 Ink-2는 정밀도와 재현율 모두 높게 유지합니다.
발화 종료 감지: 프로덕션 음성 에이전트
프로덕션 조건의 실제 음성 에이전트 통화로 종료 감지 성능을 측정한 내부 벤치마크. 높을수록 좋습니다.
micro1에서는 Ink-2로 AI 채용 에이전트 Zara를 운영합니다. 지원자와 대규모 음성 면접을 진행하는 에이전트입니다. 거의 즉시 반응하며 실제 대화의 발화 패턴을 매우 잘 처리합니다.
지연 시간: 대화가 계속 흐르도록
TTS처럼 전사 지연 시간도 대화의 자연스러움에 직접 영향을 줍니다. 우리가 보는 지표는 최종 전사까지 걸리는 시간, TTFT입니다. 사용자가 말을 마친 순간부터 최종 전사를 얻기까지의 시간입니다. 에이전트가 주의를 기울이는지, 버퍼링하는 것처럼 느껴지는지를 결정합니다.
Ink-2의 TTFT는 0.1s로 매우 짧습니다. turn.eager_end 덕분에 발화가 완전히 확정되기 전에 LLM을 시작할 수 있어, 에이전트가 실제로 대화에 참여하는 것처럼 빠르게 응답합니다.
ink-2
경쟁 모델이 시작하기도 전에 에이전트가 응답할 수 있습니다
flux-general-en
이제야 에이전트가 발신자의 발화 종료를 알아차리고 처음부터 시작합니다
Ink-2를 사용하는 팀과 함께하세요
Ink-2는 play.cartesia.ai에서 사용할 수 있습니다. API로 직접 사용하거나 LiveKit, Vapi, Pipecat 등 음성 팀이 쓰는 플랫폼에서도 이용할 수 있습니다.
음성 AI를 발전시키고 Ink-2를 프로덕션에서 사용하는 팀들과 계속 함께 만들겠습니다. 이미 높은 수준의 영어 모델을 출시했고 다국어 지원도 준비 중입니다. 어디서든 사용자의 말하는 방식에 맞는 Ink-2를 만들겠습니다.
Ink-2 사용해 보기
이 Ink 2 데모는 영어, 스페인어, 프랑스어, 힌디어, 일본어를 지원합니다. 이 데모에서는 영어로 말해 주세요.