지난달 가장 정확한 영어 스트리밍 STT 모델 Ink-2를 출시했습니다.
오늘 두 기능을 추가합니다. 복잡한 전문 개체의 전사 정확도를 높이는 키워드 프롬프팅과, 속도 또는 정확도에 맞춰 엔드포인팅을 조정하는 발화 종료 감지 설정입니다.
에이전트가 이름과 전문 용어를 더 안정적으로 전사하고 지연 시간과 발화 종료 정확도를 조정할 수 있습니다.
키워드 프롬프팅: 어려운 개체의 전사 정확도 높이기
브랜드, 약품 이름, 산업 용어는 최고의 STT 모델에도 전사하기 어려운 대상입니다. 영상과 아래 음성·전사 예시는 원래 녹음된 언어를 유지합니다.
연결을 열 때 keyterm 쿼리 파라미터에 키워드를 최대 100개, 총 1,200자까지 전달하세요. Ink-2는 추가 지연 없이 이 용어를 올바르게 전사하도록 반영합니다.
다음은 의료진이 환자에게 처방 변경을 설명하는 예시입니다. Ink-2와 Deepgram Flux에 같은 키워드 세 개를 제공했습니다.
두 모델에 제공된 핵심 용어:
ink-2
세 키워드를 모두 입력한 그대로 반환
flux-general-en
"Paracetamol"을 잘못 전사
Ink-2의 키워드 프롬프팅은 이름을 정확히 인식하는 데도 효과적입니다.
두 모델에 제공된 핵심 용어:
ink-2
두 키워드를 모두 입력한 그대로 반환
flux-general-en
두 키워드를 모두 놓침
실제 분기 실적 발표로 만든 Earnings22에서 키워드 재현율을 측정합니다. 회사명, 종목 코드, 약어처럼 범용 STT가 어려워하는 어휘가 포함됩니다.
키워드 프롬프팅 사용 시 키워드 재현율
높을수록 좋음
키워드 프롬프팅은 가장 정확한 STT 모델 Ink-2의 재현율을 20% 높입니다. 프롬프팅을 켰을 때 Deepgram Flux는 키워드의 13.5%를 놓치고 Ink-2는 6.2%만 놓칩니다. Ink-2가 놓치는 수가 절반보다 적습니다.
다음 경우에 유용합니다.
- 제품과 브랜드명: “Cartesia”, “Ink-2”
- 약품명과 임상 용어: “semaglutide”, “atorvastatin”
- 발신자 계정의 이름이나 주소
- 산업 약어와 내부 전문 용어
자체 구축한 기업용 AI 벤치마크 EVA-Bench의 평가에서 Ink-2의 개선을 수치로 확인했습니다. 항공, IT 서비스, HR 등 실제 기업 대화의 전문 어휘에서도 잘 작동합니다. 평가 사이에 확인한 개선은 우리가 조정한 결과가 아니라 Cartesia가 자체적으로 개선한 결과였습니다.
발화 종료 감지 설정: 빠른 응답 또는 정확한 종료 판단
사용 사례에 맞게 지연 시간과 엔드포인팅 정확도를 조정해 에이전트의 대화 흐름을 최적화할 수 있습니다.
Lower latency
발화를 더 빨리 종료
멈춤마다 발화를 끝내 요청을 세 부분으로 나누므로 에이전트가 더 일찍 응답할 수 있습니다.
Higher turn-taking accuracy
발화를 더 오래 유지
발신자가 잠시 멈춰도 기다리며 전체 요청을 하나의 발화로 유지합니다.
Ink-2는 균형 잡힌 기본값을 제공하지만 이제 직접 발화 종료 감지를 설정할 수 있습니다. 빠른 대화에는 짧은 지연 시간 쪽으로, 정보 수집의 정확성이 중요할 때는 발화 판단의 정확도 쪽으로 조정하세요. 연결을 열 때 설정하거나 통화 중 스트리밍하면서 바꿀 수 있습니다.
지금 사용해 보세요
키워드 프롬프팅과 발화 종료 감지 설정은 모든 Ink-2 사용자가 지금 사용할 수 있습니다. 키워드 프롬프팅과 발화 종료 감지 문서를 확인하고 play.cartesia.ai에서 Ink-2를 사용해 보세요.
