George Rybintsev는 집에서 오디션을 녹화하는 배우를 위해 ActOnCue를 만들었습니다. 배우가 대본을 업로드하고 자신의 배역을 고른 후 다른 배역을 읽는 AI 음성을 상대하며 연습합니다. Cartesia가 이 음성들의 기본 제공업체이며, ActOnCue가 ElevenLabs를 떠나게 한 모델은 Sonic 3였습니다.
과제: 혼자 해야 하지만 두 번째 사람이 필요한 작업
셀프테이프는 팬데믹 동안의 임시방편이었지만 정착했습니다. 캐스팅은 여전히 셀프테이프로 진행되며 배우는 자신의 오디션 영상을 직접 제작해야 합니다.
셀프테이프는 스태프가 필요한 유일한 1인 작업입니다. 한 사람이 카메라를 조작하면서 상대 배역을 읽을 수 있지만 노력, 시간, 편집이 두 배로 늘어납니다. 실제로 셀프테이프는 밤 10시에 룸메이트에게 전화해 줄리엣을 맡아달라고 부탁하는 일입니다.
ActOnCue는 일을 배우에게 다시 떠넘기지 않고 두 번째 사람을 대신합니다. 대본을 넣고 배역을 선택하면 바로 연습을 시작할 수 있습니다. 플랫폼은 나머지 등장인물을 찾아 음성을 자동 배정하며, 첫 실행 후에는 어느 음성이든 바꿀 수 있습니다. 배우가 오디션 전에 AI 시스템부터 설정할 필요는 없어야 합니다.
그저 A에서 B로 아주 빠르고 효율적으로 가고 싶은 겁니다.
출시 이후 ActOnCue는 대사 암기, 리허설, 여러 연기 분야의 준비 등 연기 워크플로의 다른 부분으로 확장되었습니다. 음성은 경험에서 가장 중요한 부분이 되었습니다.
ActOnCue가 Cartesia를 선택한 이유
대사 리더의 역할은 독특합니다. 반응할 수 있을 만큼 존재감이 있으면서도 신경 쓰지 않아도 될 만큼 담백해야 합니다. 배우에게 필요한 것은 상대할 대상이지 또 하나의 연기가 아닙니다. 리더가 스스로 연기적 선택을 하는 순간 배우도 그 선택에 대한 반응으로 자신의 대사를 빚기 시작하고, 셀프테이프는 더 이상 배우만의 것이 아니게 됩니다.
셀프테이프에서는 과장된 연기를 원하지 않습니다. 아주 일관적이길 원하죠. 깔끔해야 하고, 그 음성, 즉 리더의 음성이 셀프테이프를 방해하지 않아야 합니다.
ActOnCue는 ElevenLabs로 시작했지만 이 작업에는 음성이 너무 극적이라고 판단했습니다. 배우를 지원하기보다 대사를 연기하며 배우와 경쟁했습니다. ElevenLabs는 비용도 더 높았고, 로드맵도 ActOnCue에 필요한 개발자 기능보다 소비자 제품으로 향하는 것이 뚜렷했습니다.
Sonic 3가 전환점이었습니다. 배우의 연기를 압도하지 않는 대화 리듬과 사람다운 표현을 제공했습니다. Cartesia는 ActOnCue를 Cartesia Startup Grant 수혜자로 스타트업 프로그램에 받아들여 Scale 요금제를 12개월 동안 무료로 제공했습니다.
솔루션: 여러 제공업체를 지원하는 플랫폼의 기본값
ActOnCue는 여전히 여러 음성 제공업체를 제공하며, 기본으로 배정하는 것은 Cartesia입니다. 이 선택은 리허설에 실제로 필요한 것을 면밀히 검토한 결과이며 강제되지 않습니다. 배우는 언제든 제공업체를 바꿀 수 있습니다.
팀이 가장 중요하게 여기는 성과는 리더를 관리하는 데 더 이상 드는 비용이 없다는 점입니다. 스스로 중립적인 어조를 유지하는 음성에는 관리, 조정, 변명이 필요하지 않습니다. 덕분에 ActOnCue는 배우 워크플로의 나머지를 자유롭게 구축하고, 배우는 그 방에서 유일하게 중요한 자신의 연기에 집중할 수 있습니다.
결과: 배우들은 기본값을 유지합니다
- 원하는 제공업체를 고를 수 있는 플랫폼에서 ActOnCue 음성-음성 사용량의 93.3%가 Cartesia에서 처리됩니다
- ElevenLabs 음성으로 시작한 사용자의 3.9%가 이후 Cartesia로 전환합니다. 반대로 전환하는 사용자는 약 2%로, Cartesia를 떠나는 것보다 Cartesia로 옮길 가능성이 거의 두 배 높습니다
앞으로의 계획
ActOnCue의 다음 릴리스는 배우에게 순서대로 진행되는 워크플로를 제공하는 데 초점을 둔 전면 개편입니다. 음성 자동 배정은 그 방향으로의 첫걸음이었습니다. 개편은 나머지 과정입니다. 배우의 경로에 남아 있는 모든 복잡한 장치를 제품 뒤로 옮기는 것입니다. 그 경로가 단순해질수록 그 아래에서 작동하는 음성이 더 많은 역할을 맡아야 합니다.