Coval의 스트리밍 STT 벤치마크가 유용한 이유는 대화형 제품이 실제로 작동하는 추론 스택을 다시 논의에 넣기 때문이라고 생각합니다. 모델 가중치만 비교하면 사용자가 가장 크게 느끼는 지연 요소인 배포 경로, 지역, 모델 뒤의 엔드포인트를 놓칩니다.
Coval 스트리밍 STT 벤치마크의 실제 측정 대상
2026년 9월 14일 확인한 Coval WER 페이지에는 최근 30일 구간의 STT 모델 30개와 TTS 모델 28개가 있습니다. STT 표는 단어 오류율과 전사 지연시간, 샘플 수를 함께 보고합니다. 어떤 행은 수만 개 샘플이 있지만 다른 행은 훨씬 적습니다. 순위를 해석할 때 이 차이가 중요합니다. Coval WER 리더보드
페이지는 최종 세그먼트까지의 시간, 첫 토큰까지의 시간, 최종 전사까지의 시간 등 여러 지연 관점도 제공합니다. 제품마다 중요한 시점이 다르므로 유용합니다. 실시간 자막은 최종 전사 속도가 중요하고 음성 에이전트는 언제 안전하게 다시 말할 수 있는지가 중요합니다. Coval 벤치마크 개요 Coval WER 리더보드
Coval은 고정 지역에서 공개 벤치마크를 실행합니다. 모든 모델을 같은 곳에서 호출하므로 비교가 명확해지지만, 수치가 사용자의 도시나 네트워크에서 경험할 지연시간이 아니라 벤치마크 수치라는 뜻이기도 합니다. Coval 벤치마크 개요
리더보드가 추론 구간 전체를 측정하므로 이 구성이 중요합니다. 공유 엔드포인트나 부적절한 위치의 배포 뒤에 모델이 있다면 그 비용도 수치에 포함됩니다. 즉 가중치뿐 아니라 오디오가 가중치에 도달하고 돌아오는 경로도 평가합니다. Coval WER 리더보드 Coval 벤치마크 개요
스냅샷: Coval STT 리더보드에서 Baseten의 위치
9월 14일 확인한 표에서 Baseten의 Qwen3 ASR 1.7b 엔드포인트는 1,192개 샘플에 걸쳐 TTFS 39 ms와 WER 3.9%를 기록합니다. Coval 테스트 조건에서 해당 엔드포인트를 측정한 결과입니다. Coval WER 리더보드
Baseten의 글은 배포가 OpenAI보다 약 5배 빠르다고 말합니다. 원시 Coval 행은 제목보다 정확하며 비교할 OpenAI 엔드포인트에 따라 비율이 달라지는 이유도 보여 줍니다. 리더보드의 OpenAI 행들은 TTFS가 모두 같지 않기 때문입니다. Baseten 벤치마크 글 Coval WER 리더보드
Baseten의 9월 9일 글은 얼리 액세스 결과를 OpenAI보다 약 5배 빠르다고 설명합니다. 특정 기준에 대한 특정 날짜의 업체 주장으로 다루세요. 구매 결정에 비율을 적용하기 전에 양쪽 모델, 엔드포인트, 측정일, 지연시간 정의를 확인하세요. Baseten 벤치마크 글 Coval WER 리더보드
전용 추론과 배포 선택이 차이를 만드는 방식
Coval은 일부 행에 전용 추론, 다른 행에 공유 추론을 표시합니다. 많은 모델 차트가 빠뜨리는 부분이며 가중치를 전혀 바꾸지 않고도 파레토 그래프에서 배포를 왼쪽으로 옮기는 부분입니다. Coval WER 리더보드
Baseten은 결과의 요인으로 전용 추론과 조정된 자동 확장을 지목합니다. 이는 프로덕션 시스템 동작과 맞습니다. 예약 용량은 이웃 워크로드의 간섭에 따른 편차를 줄이고, 더 나은 위치 배치는 모델이 일을 시작하기 전의 네트워크 시간을 줄입니다. Baseten 벤치마크 글
공유 엔드포인트는 데모에서 괜찮아 보여도 프로덕션에서는 나쁘게 느껴질 수 있습니다. 부하가 있을 때는 중앙값만큼 지연시간의 일관성이 중요하기 때문입니다. p95가 변하거나 p25-p75 구간이 넓어지면 사용자는 단순히 느린 벤치마크 행이 아니라 망설임을 경험합니다. Baseten 벤치마크 글 Coval WER 리더보드
그래서 가까운 위치에 배치하는 것이 중요합니다. 사용자 가까이에 추론을 두면 왕복 시간이 줄고, 대화형 제품에서는 모델이 바뀌지 않아도 그 감소를 느낄 수 있습니다. Coval 벤치마크 개요
벤치마크가 통제하는 것과 제품 결정을 오도할 수 있는 부분
Coval의 고정 지역과 실행기는 잡음 원인 하나를 제거하는 좋은 방법입니다. 재현성을 높이지만 벤치마크의 공정함을 전혀 다른 개념인 제품 현실과 혼동하기도 쉬워집니다. Coval 벤치마크 개요
같은 이유로 샘플 수도 중요합니다. 행마다 표시된 수가 크게 다르므로 어떤 점 추정치 뒤에 수만 개 발화가 있고 어떤 것에는 없는지 알 수 있습니다. Coval WER 리더보드
추론 계층을 무시한 업체 비교가 자주 오해를 부르는 이유 중 하나입니다. 실험실에서 쉽게 호스팅하는 모델도 오케스트레이션, 자동 확장, 통화자와 서버 사이의 네트워크가 더해지면 비싸거나 일관성이 떨어질 수 있습니다. Baseten 벤치마크 글 Coval 벤치마크 개요
방법론은 리더보드 간 비교도 바꿉니다. TTFS, TTFT, 최종 전사 시간은 서로 바꿔 쓸 수 없습니다. 같다고 읽으면 서로 다른 질문에 답하는 수치를 비교하게 됩니다. Coval WER 리더보드
구축: 낮은 지연시간과 WER의 STT 파이프라인 재현, Cartesia Ink-2 예시
음성 에이전트의 응답을 빠르게 하려면 전사뿐 아니라 차례 전환을 위해 만든 STT 모델을 고르는 것부터 시작하세요. Cartesia Ink-2는 설정 가능한 차례 감지와 핵심 용어 프롬프팅을 제공합니다. 사용자가 끝냈다고 판단하는 시점을 조정하고 예상할 이름과 전문 용어를 알려 줄 수 있습니다. Cartesia Ink-2 문서
엔드포인팅은 반응성의 일부이므로 중요합니다. 차례를 확정하기까지 너무 기다리면 나머지 스택이 쉬고, 너무 일찍 끝내면 사용자의 말을 끊습니다. 필요한 것은 더 큰 모델이 아니라 실제로 제어할 수 있는 차례 감지기입니다. Cartesia Ink-2 문서 LiveKit Agents
같은 모델도 배포에 따라 결과가 달라집니다. Coval은 전용 추론과 공유 구성을 구분하여 이를 보여 줍니다. Baseten의 글도 업체 측에서 같은 패턴을 보여 줍니다. 가중치를 바꾸지 않고 배포 선택만으로 지연시간이 달라집니다. Coval Ink-2 항목 Baseten 벤치마크 글
가장 이른 부분 전사보다 최종 전사의 정확도가 중요하면 의미 기반 확정에 무게를 두세요. 제품이 먼저 말해야 한다면 빠른 부분 전사가 유리할 수 있지만, 이는 짧은 대화 공백을 얻는 대신 전사 위험을 조금 더 감수하는 명시적 선택입니다. Artificial Analysis AA-WER Streaming
Artificial Analysis의 2026년 6월 1일 보고서는 의미 기반 엔드포인트를 쓴 Ink-2에서 WER 3.59%, 발화 종료 감지 후 첫 최종 전사까지 0.21초를 측정했습니다. 같은 모델도 데이터셋, 엔드포인트 설정, 시간 정의가 다르면 결과가 달라질 수 있습니다. Artificial Analysis AA-WER Streaming Coval Ink-2 항목
새 모델을 고르기 전에 사용할 만한 또 다른 수단은 핵심 용어 프롬프팅입니다. 제품명이나 내부 용어를 잘못 전사한다면 예상 단어를 STT에 알려 주는 것이 보통 업체를 바꾸는 것보다 저렴하고 문제에 직접 대응합니다. Cartesia Ink-2 문서
프로덕션 조정에는 프레임워크 지원도 중요합니다. LiveKit Agents는 차례 감지와 핵심 용어 설정을 두기에 적합한 제공업체 설정 훅을 제공합니다. 목표는 모델을 감상하는 것이 아니라 실제 출시할 통화 경로에 연결하는 것입니다. LiveKit Agents
실제 절충: 가장 빠른 전사는 정확도를 희생할 수 있으며 그 반대도 같습니다
Artificial Analysis의 2026년 6월 1일 결과에서 Deepgram Flux는 WER 7.36%, 발화 종료 감지 후 첫 최종 전사까지 0.020초를 기록했습니다. 의미 기반 엔드포인트의 Ink-2는 같은 지표에서 3.59%와 0.21초였습니다. Flux는 최종 전사를 더 빨리 반환했고 Ink-2는 이 테스트에서 오류가 더 적었습니다. 테스트한 구성과 데이터셋에 대한 결과입니다. Artificial Analysis AA-WER Streaming
스트리밍 STT 벤치마크는 이렇게 봐야 합니다. 추상적으로 가장 좋은 모델을 알려 주지 않습니다. 속도에서 이겨도 통화자를 잘못 연결하거나 제품명을 놓치는 등 실제 에이전트에 중요한 오류에서는 질 수 있기 때문입니다. Coval WER 리더보드 Artificial Analysis AA-WER Streaming
꼬리 지연시간은 대체로 좋은 시스템을 짜증 나는 시스템으로 만드는 부분입니다. 중앙값이 낮아도 p95나 p99 꼬리가 길면 평균은 괜찮아 보여도 사용자는 에이전트가 확신하지 못하는 듯한 쉼을 때때로 기다려야 합니다. Coval WER 리더보드
배포 위치, 엔드포인트 용량, 차례 감지, 핵심 용어 프롬프팅을 따로 테스트하세요. 결합하기 전에 각 변경이 오류와 지연시간에 미친 영향을 기록하세요. 어떤 변경이 앱을 개선하는지 근거를 얻을 수 있습니다. Baseten 벤치마크 글 Cartesia Ink-2 문서
제공업체 선택 전에 자체 스택에서 측정할 것
중요한 수치는 자신의 경로에서 측정한 값입니다. STT에서는 실제 전화 또는 WebRTC 조건에서 발화 종료 감지부터 최종 세그먼트 도착까지 측정해야 합니다. 실제 네트워크를 우회하는 깨끗한 실험실 경로가 아닙니다. Coval 벤치마크 개요
중앙값뿐 아니라 백분위수도 필요합니다. p50은 좋아도 p95와 p99가 퍼지면 사용자는 가끔 빠르고 가끔 어색한 시스템을 듣습니다. 보통 조금 느려도 일관적인 시스템보다 나쁩니다. Coval WER 리더보드
앱이 처리해야 할 억양, 배경 소음, 전문 어휘가 포함된 대표적인 프로덕션 오디오를 재생하세요. 개발에 쓴 녹음만 최적화하지 않도록 별도 평가 세트를 유지하세요.
공개 리더보드는 최종 답이 아니라 후보 목록으로 사용하세요. 후보를 정한 뒤 사용자가 무엇을 듣게 될지 결정하기 전에 자신의 지역, 동시성, 스택에서 실행하세요. Coval 벤치마크 개요 Baseten 벤치마크 글
소수의 후보 엔드포인트와 고정 평가 코퍼스로 시작하세요. 예상 동시성에서 전사 오류, 확정 지연, 발화 종료부터 첫 오디오까지의 지연시간을 기록하세요. 앱의 오류 및 응답 시간 목표를 충족하는 구성을 고르고 모델이나 배포가 바뀌면 테스트를 반복하세요.