고객 사례

Speko의 음성 AI 벤치마크가 가장 자주 추천하는 모델, Sonic 3.5

Speko는 음성 AI 라우터입니다. 개발자는 하나의 Speko API로 음성 에이전트를 구축하고 실행하며, Speko는 각 통화의 언어와 용도에 따라 음성 텍스트 변환, LLM, 텍스트 음성 변환 모델을 선택합니다. 이 선택은 약 12개 제공업체를 대상으로 2~3일마다 다시 실행하는 벤치마크에 기반합니다. 텍스트 음성 변환 부문에서 가장 자주 1위를 차지하는 모델은 Cartesia의 Sonic 3.5입니다.

기본적으로 음성 AI의 개방형 라우터를 만들고 있습니다. 사람들이 적합한 모델 스택을 선택하도록 돕는 중립적인 계층이 되고자 합니다.

Beknazar AbdikamalovSpeko 창립자

과제: 세 가지 모델을 결정해야 하지만 중립적으로 물어볼 곳이 없다

음성 AI의 약 95%는 음성 텍스트 변환, LLM, 텍스트 음성 변환 순서의 연쇄 구조로 실행됩니다. 에이전트 하나당 세 가지 모델을 따로 결정해야 하며, 이에 관해 의견을 내는 제공업체 대부분은 답에 이해관계가 있습니다. 새로운 제공업체가 계속 등장해 매달 선택지가 늘어나지만, 어떤 모델이 실제로 제 역할을 하는지는 더 명확해지지 않습니다.

영어를 벗어나면 더 어려워집니다. 영어를 잘 읽는 모델도 다른 언어에서는 음성이 흔들리거나 단조로워질 수 있는데, 어떤 모델이 그런지 알려 주는 공개 데이터는 거의 없습니다. 자체 평가를 실행할 만큼 규모가 큰 기업은 어떤 스택이 어디에서 작동하는지 이미 알고 있습니다. 나머지는 마케팅 페이지를 보고 선택합니다.

솔루션: 2~3일마다 갱신되는 벤치마크

Speko는 단계적으로 평가하여 새 모델에 본격적으로 비용을 쓰기 전에 저렴한 자동 검사를 거치게 합니다. 에이전트가 X와 Hugging Face에서 유망한 출시를 살피고, 발견한 모델은 먼저 이 검사를 받습니다. 좋은 성과를 낸 모델은 사람의 평가와 더 많은 예산을 투입하는 테스트로 넘어갑니다. 어느 시점이든 약 12개 제공업체를 추적합니다.

2~3일마다 벤치마크를 다시 실행하면 지난 분기에 출시된 모델이 아니라 현재 모델 버전을 기준으로 수치를 유지할 수 있습니다. 각 범주에는 고유한 기준이 있습니다. 텍스트 음성 변환에는 세 가지가 있습니다.

  • 명료성: 단어를 정확히 읽는 것을 넘어 맥락을 이해하고 의미에 맞으며 실제 서비스에 사용할 수 있는 방식으로 텍스트를 읽는가?
  • 변동: 생성 과정 전반에서 음성이 일관되게 유지되는가, 아니면 품질, 어조, 타이밍이 흔들리는가?
  • 자연스러움: 사람처럼 들리는가, 아니면 경험을 해치는 기계적인 특성이 있는가?

세 항목을 따로 채점하기 때문에 용도에 맞는 추천이 가능합니다. Abdikamalov는 대부분의 고객을 두 그룹 중 하나로 분류합니다. 고객 지원 에이전트는 지연시간을 중시하며 빠르고 정확한 완료로 성공을 측정합니다. AI 코치와 치료 제품은 사람처럼 느껴지는 음성이 필요합니다. 대부분의 제공업체는 둘 중 하나에 강합니다.

Speko가 Cartesia를 선택한 이유

Sonic 3.5는 속도와 자연스러움의 가장 뛰어난 조합으로 Speko의 전체 텍스트 음성 변환 순위에서 선두를 차지하며, Speko가 추적하는 다른 모델과 비교해 가격 경쟁력도 유지합니다. 이 두 축은 지원을 위한 지연시간, 코칭과 치료를 위한 자연스러움처럼 Speko 고객이 만드는 제품의 대부분을 포괄합니다. 둘 다 뛰어난 경우는 드물기 때문에 Sonic 3.5가 Speko에서 가장 자주 추천하는 텍스트 음성 변환 모델입니다.

여기서 기본이라는 말은 자동으로 선택된다는 뜻이 아니라 가장 자주 추천된다는 뜻입니다. 고객 요구에 다른 모델이 더 적합하면 Speko는 그쪽으로 연결합니다. 추천은 용도를 따르며, Sonic은 중요한 기준에서 많은 경우에 우위를 보입니다.

앞으로의 방향: 모델 선택을 의식할 필요 없게 만들기

Speko는 두 가지를 동시에 추진하고 있습니다. 첫째는 고객이 모델 선택을 전혀 고민하지 않아도 되게 만드는 것입니다. Abdikamalov는 적합한 스택을 선택하는 일이 고객이 내부 모델을 얼마나 잘 이해하는지에 좌우되지 않기를 바랍니다.

모델 선택을 몰라도 되게 만들고 싶습니다. 이상적으로는 내부에서 무엇이 작동하는지조차 알 필요가 없어야 한다고 생각합니다.

Beknazar AbdikamalovSpeko 창립자

둘째는 업계가 신뢰하는 벤치마크가 되는 것입니다. 많은 순위표가 결과를 검증할 만큼 충분한 방법론을 공개하지 않고 음성 모델의 순위를 매깁니다. 다른 곳은 실제 서비스에서의 동작을 거의 보여 주지 못하는 제한된 데모에 의존합니다. Speko는 정해진 주기로 갱신되고 작동 방식을 공개하며 고객이 실제로 만드는 것을 테스트하는 벤치마크를 원합니다.

Abdikamalov는 현재 기업의 약 1%가 음성 AI를 사용한다고 추정합니다. 그 수치가 커지면 모델 수도 늘어나겠지만, 어떤 모델을 어디에서 신뢰할 수 있는지 알아내야 한다는 어려움은 그대로 남습니다.