도구 / 음성 텍스트 변환
스트리밍 정확도 1위 Ink-2 기반
위 데모는 Cartesia의 스트리밍 음성 텍스트 변환 모델 Ink-2로 작동합니다. 1위를 기록한 평가에는 다음이 있습니다. VoiceArena 미국 영어 리더보드 및 Artificial Analysis 스트리밍 벤치마크, 또한 전화번호, 이메일, UUID 같은 구조화된 데이터를 처음부터 정확하게 전사합니다. 발화 차례 감지 기능이 내장되어 전사문이 자동으로 차례별로 나뉘며 별도의 정리 필터 없이 배경 소음 속에서도 정확도를 유지합니다.
추천 용도
- 음성 에이전트
- 실시간 자막
- 받아쓰기
- 회의록
- 통화 분석
작동 방식
마이크를 누르고 말하세요. 말하는 동안 단어가 표시되며 가입은 필요하지 않습니다.
말하는 도중 멈추거나 주제를 바꿔 보세요. Ink-2가 발화 차례의 시작과 끝을 표시해 전사문을 대화처럼 읽을 수 있습니다.
전사문을 복사하거나 API를 통해 앱에서 같은 모델을 스트리밍하세요.
프로덕션에 적용
이 페이지에서 사용하는 모델은 API와 SDK에서 제공하는 것과 같은 Ink-2입니다. 실시간 사용에는 WebSocket으로 라이브 오디오를 스트리밍하고 완성된 파일은 배치 엔드포인트로 보내세요. 핵심 용어 프롬프팅 기능은 제품에서 자주 듣는 이름과 전문 용어를 우선 인식하도록 돕습니다. 엔터프라이즈 요금제는 데이터 보관 없이 온프레미스, VPC, OEM 배포를 제공합니다.
더 많은 음성 도구 살펴보기
자주 묻는 질문
음성 텍스트 변환이란 무엇인가요?
음성 텍스트 변환은 STT, ASR, 전사라고도 하며 말한 오디오를 글로 바꿉니다. Cartesia는 스트리밍 모델인 Ink-2를 사용하므로 말을 멈춘 뒤가 아니라 말하는 동안 전사문이 나타납니다.
이 음성 텍스트 변환 도구는 무료인가요?
네. 이 페이지의 데모는 계정 없이 마이크 음성을 전사합니다. 무료 Cartesia 계정을 만들면 한도가 늘어나고 유료 요금제에서는 프로덕션 API 사용량을 추가할 수 있습니다.
어떤 언어를 지원하나요?
Ink-2는 영어, 프랑스어, 힌디어, 일본어, 스페인어를 전사하고 언어를 자동 감지합니다. 실시간 사용을 위해 설계되었습니다. 사전 녹음 파일의 경우 배치 STT API는 ink-whisper를 사용합니다.
발화 차례 감지란 무엇인가요?
발화 차례 감지는 화자가 말을 마쳤는지 판단해 음성 에이전트가 말을 끊거나 불필요한 침묵을 만들지 않게 합니다. 대부분의 스택은 이를 위해 별도 음성 활동 모델을 추가합니다. Ink-2는 turn.eager_end, turn.end 같은 차례 이벤트를 직접 내보내므로 스택에서 모델 하나를 줄이고 더 빠르게 응답할 수 있습니다.
마이크 대신 오디오 파일을 전사할 수 있나요?
이 페이지의 데모는 실시간 마이크 입력으로 작동합니다. 녹음에는 전체 파일을 받아 하나의 전사문을 반환하는 배치 STT API를 사용하세요.
자체 인프라에서 실행할 수 있나요?
네. Ink-2는 에어갭 환경을 포함한 온프레미스, AWS·GCP·Azure의 자체 VPC, 또는 제품에 내장하는 OEM 라이선스로 배포할 수 있습니다. 이러한 배포는 엔터프라이즈 계약으로 제공됩니다.
오늘 시작하세요
전문가와 상담하세요.
팀원과 연결해 Cartesia가 세계적 수준의 음성 경험을 만드는 데 어떻게 도움이 되는지 알아보세요.
개발을 시작하세요.
API로 모델을 사용하고 몇 분 만에 음성 에이전트를 프로덕션에 배포하세요.