TTS 모델과 목소리를 서로 다른 입력으로 보여주는 다이어그램

TTS 모델과 목소리는 다릅니다

TTS 모델은 음성을 생성합니다. 하지만 모델과 그 모델이 사용하는 목소리는 다릅니다. 둘을 혼동하면 음성 AI 설계에서 잘못된 결정을 내리게 됩니다.

[제품]

세이지 그린과 연회색 수채화 면 세 개와 검은 윤곽선 사각형 하나로 구성된 2x2 격자

정밀도와 재현율이 중요한 이유

아무것도 하지 않는 모델이 90%를 받기 전까지는 정확도가 적절한 지표처럼 보입니다. 정밀도와 재현율이 더 솔직한 평가를 제공하는 이유와 음성 AI에서의 의미를 살펴봅니다.

[제품]

3.6이 적힌 초록색 수채화 말풍선 위에 손그림 윤곽선 종이가 겹친 이미지

Sonic-3.6 소개

Sonic-3.6은 Sonic-3.5보다 자연스러움과 품질이 크게 개선되었습니다. 15개 로케일의 블라인드 일대일 평가에서 청취자가 최대 93%의 비율로 선호했습니다.

[제품]

enclomiphene, zuclopenthixol, pityriasis처럼 전사하기 어려운 이름이 마이크를 둘러싸고 옆에는 aminophylline이 선명하게 표시된 이미지

Ink-2의 새 기능: 키워드 프롬프팅과 발화 종료 감지 설정

Ink-2에 두 기능을 추가했습니다. 전문 용어의 전사 정확도를 높이는 키워드 프롬프팅과 속도 또는 정확도에 맞춰 조정하는 발화 종료 감지입니다.

[제품]

이 TTS 모델은 좋은 모델일까요?

이 TTS 모델은 좋은 모델일까요?

모델이 발전할수록 음성 합성 평가가 어려워지는 이유와 실제로 중요한 요소를 측정하는 방법을 살펴봅니다.

[연구]

음성 인식 전사를 표현하듯 말한 질문의 단어들이 나선형으로 마이크에 들어가는 이미지

Ink-2 소개: 음성 에이전트를 위한 1위 STT

실시간 음성 에이전트를 위한 음성 인식 모델 Ink-2를 출시합니다. Artificial Analysis 스트리밍 리더보드 1위이며 가장 정확한 내장 발화 종료 감지를 제공합니다.

[소식]

반투명 초록색 꽃잎들이 겹친 장미 모양의 중심에서 윤곽선 원 세 개가 교차하는 이미지

음성 AI 모델 선택 가이드

실험실이 아닌 실제 사용 사례를 기준으로 ASR, TTS, 발화 종료 감지 모델을 평가하는 실용적인 방법입니다.

[제품]

녹색 수채화 여섯 점. 각각 채색된 면과 손으로 그린 사각형 윤곽선을 다르게 배치했습니다.

처음 배우는 음성 AI 용어

대화형 음성 AI를 이해하고 평가하고 만드는 데 필요한 핵심 용어 20개를 쉬운 말로 설명합니다.

[제품]

녹색으로 칠한 띠 위를 왼쪽에서 오른쪽으로 가로지르는 어두운 평행선들이 중앙에서 교차한 뒤 이어집니다

Mamba-3: 추론을 우선한 상태 공간 모델

Mamba-3는 현대적인 추론 워크로드를 중심으로 상태 공간 모델을 재설계합니다. 선형 모델의 장점인 낮은 지연시간을 유지하면서 품질을 높입니다.

[연구]

같은 고리 모양 선 기호 네 개가 연초록, 초록, 회색, 진초록으로 나란히 그려진 이미지

Cartesia에서 Claude 군단을 키울 소프트웨어 엔지니어를 찾습니다

코드 작성은 해결된 것 같습니다. 하지만 엔지니어링은 아직입니다. 그 간극을 메울 분을 찾습니다.

[엔지니어링]

호박색 유럽연합 별 고리 옆에 GDPR 준수 문구와 Cartesia 워드마크가 표시된 이미지

Cartesia, GDPR 준수 달성

Cartesia의 음성 합성 플랫폼이 GDPR을 준수합니다. 데이터 보호, 개인정보 보호, 책임 있는 인간 중심 AI에 대한 약속을 이어갑니다.

[소식]

수채화로 그린 반투명 초록색 사각형 여러 개가 약간씩 기울어 겹쳐 있고 중심으로 갈수록 색이 짙어지는 이미지

Line 소개: 현대적인 음성 에이전트 개발 플랫폼

Cartesia의 음성 에이전트 개발 플랫폼 Line을 소개합니다. 최고의 제품은 코드로 만든다는 생각에서 Line은 코드 중심으로 설계되었습니다.

[제품]

초록색 수채화와 손그림 윤곽선으로 그린 블록 세 줄. 위쪽이 가장 넓고 짙으며 아래쪽이 가장 좁고 옅습니다.

계층적 모델링

입력을 상위 개념으로 묶어 원시 데이터에서 직접 학습하고 토큰화의 한계를 넘는 계층적 아키텍처 H-Net을 소개합니다.

[연구]

Ink 소개: 실시간 대화를 위한 음성 인식 모델

Ink 소개: 실시간 대화를 위한 음성 인식 모델

실시간 음성 애플리케이션 개발자를 위한 스트리밍 음성 인식 모델군 Ink를 소개합니다. Ink-Whisper는 엔터프라이즈급 음성 에이전트에 맞춘 가장 빠르고 저렴한 STT 모델입니다.

[제품]

Organizations와 Dashboards 소개

Organizations와 Dashboards 소개

음성 AI를 확장하는 개발자를 위해 Cartesia를 만들고 있습니다. 오늘 협업과 현황 파악을 돕는 두 기능, Organizations와 Dashboards를 소개합니다.

[제품]

Professional Voice Cloning 소개

Professional Voice Cloning 소개

Sonic으로 학습한 전문가 수준의 음성 복제 Professional Voice Cloning, PVC를 소개합니다. 이제 Startup+ 플랜에서 사용할 수 있습니다.

[제품]

Cartesia Python SDK v2.0.0

Cartesia Python SDK v2.0.0

Python에서 Cartesia의 AI 음성 기능을 사용하는 개발 경험을 개선한 Python SDK v2.0.0을 출시합니다.

[엔지니어링]

Cartesia, Wing Venture Capital의 제7회 Enterprise Tech 30 선정

Cartesia, Wing Venture Capital의 제7회 Enterprise Tech 30 선정

생성형 오디오 모델 제공업체 Cartesia가 성장 단계 전반에서 가장 유망한 비상장 기업 기술 회사를 선정하는 제7회 Enterprise Tech 30에 이름을 올렸습니다.

[소식]

시리즈 A와 음성 AI의 미래

시리즈 A와 음성 AI의 미래

Kleiner Perkins가 주도한 $64 million 시리즈 A 투자를 발표합니다. 새 투자금으로 팀을 확장하고 차세대 모델 개발을 위한 연구에 투자합니다.

[소식]

Llamba: 효율적인 언어 처리를 위한 증류 순환 모델 확장

Llamba: 효율적인 언어 처리를 위한 증류 순환 모델 확장

앞으로 몇 년간 온디바이스 AI의 새 시대가 열릴 것입니다. 온디바이스 모델은 다양한 애플리케이션을 지원하게 됩니다.

[연구]

Cartesia로 음성 AI 에이전트 만드는 방법

Cartesia로 음성 AI 에이전트 만드는 방법

아키텍처부터 프로덕션 배포까지, Cartesia Sonic 음성 합성으로 자연스럽고 지연 시간이 짧은 음성 AI 에이전트를 만드는 단계별 가이드입니다.

[엔지니어링]

2024 음성 AI 현황

2024 음성 AI 현황

첫 2024 State of Voice 보고서에서 산업을 발전시키는 인프라의 변화와 새 사용 사례를 살펴보고 2025년을 전망합니다.

[연구]

시드 투자 유치를 발표합니다

시드 투자 유치를 발표합니다

Index Ventures가 주도하고 Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel과 엔젤 투자자 90명이 참여한 $27M 시드 투자를 발표합니다.

[소식]

Cartesia의 해커톤 시즌

Cartesia의 해커톤 시즌

2024년 10월, Cartesia는 샌프란시스코 전역에서 개발자 2,000명 이상과 함께했습니다. Sonic으로 만든 창의적인 아이디어에 총 $20,000의 상금을 수여했습니다.

[엔지니어링]

Voice Changer 소개: 원하는 대로 오디오 바꾸기

Voice Changer 소개: 원하는 대로 오디오 바꾸기

Voice Changer는 원래의 표현, 감정, 운율을 유지하면서 오디오 클립의 목소리를 스튜디오급 음성이나 복제 음성으로 바꿉니다.

[제품]

Sonic Multilingual에 8개 언어 추가

Sonic Multilingual에 8개 언어 추가

Sonic Multilingual에서 힌디어, 이탈리아어, 한국어, 네덜란드어, 폴란드어, 러시아어, 스웨덴어, 튀르키예어의 알파 버전을 출시합니다.

[제품]

온디바이스 지능 업데이트

온디바이스 지능 업데이트

Cartesia는 어디서나 실행되는 상호작용형 지능, 누구나 곁에서 사용할 수 있는 차세대 AI를 만들고 있습니다.

[연구]

Sonic 발표: 사실적인 음성을 위한 저지연 음성 모델

Sonic 발표: 사실적인 음성을 위한 저지연 음성 모델

오늘 사실적인 음성을 생성하는 저지연 음성 모델 Sonic을 출시합니다.

[연구]

Based: 회상 능력과 처리량의 균형을 잡는 단순한 선형 어텐션 언어 모델

Based: 회상 능력과 처리량의 균형을 잡는 단순한 선형 어텐션 언어 모델

Based는 프롬프트 처리에서 FlashAttention-2보다 56%, Mamba보다 44% 빠릅니다. 텍스트 생성 처리량은 FlashAttention-2보다 24배 높습니다.

[연구]

Mamba-3B-SlimPJ: 최고 수준의 Transformer에 견주는 상태 공간 모델

Mamba-3B-SlimPJ: 최고 수준의 Transformer에 견주는 상태 공간 모델

Cartesia 및 Together와 함께 지금까지 가장 강력한 Mamba 언어 모델 Mamba-3B-SlimPJ를 Apache 2.0 라이선스로 공개합니다.

[연구]

오늘 시작하세요

전문가와 상담하세요.

팀원과 연결해 Cartesia가 세계적 수준의 음성 경험을 만드는 데 어떻게 도움이 되는지 알아보세요.

영업팀 문의

개발을 시작하세요.

API로 모델을 사용하고 몇 분 만에 음성 에이전트를 프로덕션에 배포하세요.

Cartesia 사용해 보기