Ink: 가장 빠르고 정확한 음성 텍스트 변환 모델

정확도 1위. 의미 기반 발화 종료 감지와 업계 최고 수준의 낮은 지연 시간으로 음성 에이전트를 위해 설계했습니다.

이 Ink 2 데모는 영어, 스페인어, 프랑스어, 힌디어, 일본어를 지원합니다. 이 데모에서는 영어로 말해 주세요.

클릭하거나 Space 키를 눌러 전사 시작
탭하여 전사 시작
대화 주제가 필요하세요?
이번 달에 기대되는 일이 있나요?

비즈니스가 향하는 모든 환경을 위한 하나의 전사 모델

기차가 덜컹거리며 지나가고 머리 위 안내 방송이 지직거립니다. Ink-2는 발신자가 말하는 모든 단어를 전사합니다.

시끄러운 도시

아침 거리 풍경 일러스트
낮 거리 풍경 일러스트
밤 거리 풍경 일러스트
아침 거리 풍경 일러스트

음성 에이전트를 위한 설계

프로덕션 에이전트가 신뢰하는 전사 계층, Ink를 만드는 네 가지 기능.

정확도

처음부터 정확하게 듣습니다.

실제 작동 방식

음성 에이전트에서 전사문은 다른 모든 기능의 기반입니다. 전사 오류는 LLM 입력을 훼손하고 상호작용을 잘못된 방향으로 이끕니다.

반대도 마찬가지입니다. 정확성의 효과는 누적되며, 정밀한 전사문은 더 나은 응답과 문제를 해결하는 통화로 이어집니다.


Ink-2의 접근 방식

Ink는 스트리밍 STT 모델 중 가장 낮은 단어 오류율(WER)을 기록하며, 전화번호, 날짜, 이메일, 통화, UUID 같은 구조화된 데이터를 기본적으로 처리합니다. 전화 통신, 배경 소음, 다양한 억양 등 실제 오디오 환경에 맞게 설계되었습니다.

날짜, 영숫자, ID

대화 흐름

언제 말을 시작하고 끝내는지 압니다.

실제 작동 방식

대화에는 두 가지 중요한 순간이 있습니다. 발신자가 말을 시작할 때와 끝낼 때입니다. 시작을 놓치면 에이전트는 발화 전체를 놓칩니다. 종료를 너무 일찍 판단하면 생각이 끝나기 전에 끼어듭니다. 적합한 전사 모델은 기다림 없이 두 순간을 모두 정확하게 감지합니다.


Ink-2의 접근 방식

Ink-2에는 발화 차례 감지 기능이 내장되어 있습니다. 모델이 turn.start와 turn.end를 직접 알리므로 외부 VAD를 통합하거나 유지할 필요가 없습니다. 더 낮은 지연 시간을 위해 turn.eager_end는 발화 종료가 확정되기 전에 LLM이 먼저 시작하도록 합니다.

의미 기반 엔드포인팅은 침묵이 아닌 의미로 발화 종료를 판단하므로 생각하는 중간의 쉼이 에이전트를 성급하게 작동시키지 않습니다.

ink-2

10.1초 더 빠름

경쟁 모델이 시작하기도 전에 에이전트가 응답할 수 있습니다

flux-general-en

15.9s

이제야 에이전트가 발신자의 발화 종료를 알아차리고 처음부터 시작합니다

속도

발신자가 말을 멈추면,
에이전트가 생각을 시작합니다.

실제 작동 방식

전사가 빠르고 일정하면 에이전트의 응답은 즉각적으로 느껴집니다. 열 번 중 한 번 전사가 느리면 열 번의 통화 중 한 번은 그 반응성이 깨집니다. 아홉 번의 좋은 통화가 어색했던 한 번을 상쇄하지는 못합니다.


Ink-2의 접근 방식

Ink는 실시간 대화를 위해 설계한 맞춤 추론 엔진을 기반으로 하는 가장 빠른 스트리밍 ASR 모델입니다. 최종 전사문까지의 시간은 0.1초이며, turn.eager_end가 마지막 단어와 첫 응답 사이의 간격을 줄입니다.

Ink
88ms
눈 깜빡할 사이
100ms
사람의 응답 인지 기준
150ms

비용

규모가 커져도 비용 부담이 늘지 않는 품질.

실제 작동 방식

음성은 소통을 위한 가장 자연스러운 인터페이스입니다. 대규모에서 비용과 품질을 모두 충족하면 모든 에이전트 상호작용의 기본 인터페이스로 어디서나 음성을 사용할 수 있습니다.


Ink-2의 접근 방식

Ink의 상태 공간 모델 아키텍처는 트랜스포머 대비 10~100배의 처리량을 제공합니다. 품질을 희생하지 않고 대규모 연산 비용을 낮춥니다. 모델 스택을 지속적으로 최적화하므로 규모가 커질수록 단위 경제성이 개선됩니다.

엔터프라이즈 수준의 보안.클라우드에서 로컬까지.

  • HIPAA 준수 배지

    HIPAA 준수

  • SOC 2 Type 2 배지

    SOC 2 Type 2

  • GDPR 배지

    GDPR

  • PCI 배지

    PCI

자주 묻는 질문

Ink-2가 음성 에이전트를 위한 최고의 STT인 이유는 무엇인가요?

Ink-2는 프로덕션 음성 에이전트를 위해 설계된 Cartesia의 스트리밍 음성 텍스트 변환 모델입니다. TTS와 마찬가지로 스탠퍼드에서 창업팀이 개척한 상태 공간 모델 SSM 아키텍처를 기반으로 하며, 덕분에 다음 세 가지를 동시에 제공합니다.

스트리밍 STT 모델 중 가장 낮은 WER. Ink-2는 전화번호, 이메일, UUID 같은 영숫자를 포함해 통화 녹음, 억양이 있는 음성, 소음 환경, 실적 발표 통화에서 Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro, ElevenLabs Scribe-2-realtime 및 다른 프로덕션 스트리밍 모델보다 뛰어난 성능을 보입니다.

최고 수준의 발화 차례 감지 내장. Ink-2는 발화 종료 감지가 모델에 통합되어 있어 스택에 Silero 같은 별도의 차례 감지 모델이 필요하지 않습니다. 의존성은 줄고 지연 시간은 낮아지며 차례 감지는 더 정확해집니다.

배경 소음 대응 내장. Ink-2는 Krisp나 다른 오디오 필터 없이도 배경 소음에 잘 대응해 스택의 비용과 지연 시간을 줄입니다.

Ink-2에서도 Krisp나 Silero가 필요한가요?

아니요. 이는 팀들이 Ink-2로 전환하는 주요 이유 중 하나입니다.

발화 차례 처리가 내장되어 있습니다. 대부분의 STT 모델은 사용자가 말을 마쳤는지 알기 위해 Silero 같은 외부 차례 감지기가 필요합니다. Ink-2는 이를 기본적으로 처리하며 별도 모델을 실행하는 것보다 빠르고 정확합니다.

배경 소음 대응이 내장되어 있습니다. 대부분의 음성 에이전트는 배경 소음을 제거하려고 STT 위에 Krisp나 유사 오디오 필터를 추가해 비용, 지연 시간, 복잡성이 늘어납니다. Ink-2는 추가 설정 없이 배경 소음에 대응합니다.

스택의 모델 수가 적으면 지연 시간과 비용이 줄고 장애 지점도 감소합니다.

Ink-2를 온프레미스나 자체 클라우드 VPC에서 실행할 수 있나요?

네. Ink-2는 다음과 같이 배포할 수 있습니다.

에어갭 환경을 포함한 자체 데이터센터의 온프레미스

AWS, GCP, Azure의 자체 VPC

제품에 Ink-2를 직접 내장하는 OEM 라이선스

이 덕분에 Ink-2는 정부 계약, 의료·금융 서비스·보험 같은 규제 산업, 데이터 주권이나 저장 위치 요구사항이 있는 고객에게 적합합니다. 온프레미스 및 OEM 배포는 엔터프라이즈 계약으로 제공됩니다.

Ink-2는 어떤 언어를 지원하나요?

Ink-2는 영어, 스페인어, 프랑스어, 힌디어, 일본어를 지원합니다.

Ink-2의 비용은 얼마인가요?

Ink-2 요금은 초당 3크레딧입니다. 자세한 요금과 대량 할인은 https://www.cartesia.ai/pricing 의 요금 페이지에서 확인할 수 있습니다. 기업 계약에는 사용량과 배포 방식에 따른 맞춤 요금이 포함됩니다.

Cartesia는 자격을 갖춘 초기 기업에 크레딧을 제공하는 스타트업 지원 프로그램도 운영합니다. https://www.cartesia.ai/startups 에서 확인하세요.

언제 영업팀에 문의해야 하나요?

다음 중 해당하는 사항이 있으면 Cartesia 팀에 문의하세요.

5,000만 크레딧을 초과하는 대규모 프로덕션 워크로드 운영

온프레미스, VPC, OEM 배포 필요

의료, 금융 서비스, 규제 산업을 위한 BAA, 데이터 무보관, 기타 계약상 규정 준수 조건 필요

정부, 연방정부, 공공 부문 조달

평가, 프로토타이핑, 소규모 프로덕션 워크로드 등 그 밖의 경우에는 셀프서비스 요금제와 https://docs.cartesia.ai/build-with-cartesia/stt-models/latest 의 기술 문서로 시작할 수 있습니다.

오늘 시작하세요

전문가와 상담하세요.

팀원과 연결해 Cartesia가 세계적 수준의 음성 경험을 만드는 데 어떻게 도움이 되는지 알아보세요.

영업팀 문의

개발을 시작하세요.

API로 모델을 사용하고 몇 분 만에 음성 에이전트를 프로덕션에 배포하세요.

Cartesia 사용해 보기