Cartesia 블로그
[제품]


TTS 모델과 목소리는 다릅니다
TTS 모델은 음성을 생성합니다. 하지만 모델과 그 모델이 사용하는 목소리는 다릅니다. 둘을 혼동하면 음성 AI 설계에서 잘못된 결정을 내리게 됩니다.
[제품]

정밀도와 재현율이 중요한 이유
아무것도 하지 않는 모델이 90%를 받기 전까지는 정확도가 적절한 지표처럼 보입니다. 정밀도와 재현율이 더 솔직한 평가를 제공하는 이유와 음성 AI에서의 의미를 살펴봅니다.
[제품]

Sonic-3.6 소개
Sonic-3.6은 Sonic-3.5보다 자연스러움과 품질이 크게 개선되었습니다. 15개 로케일의 블라인드 일대일 평가에서 청취자가 최대 93%의 비율로 선호했습니다.
[제품]

Ink-2의 새 기능: 키워드 프롬프팅과 발화 종료 감지 설정
Ink-2에 두 기능을 추가했습니다. 전문 용어의 전사 정확도를 높이는 키워드 프롬프팅과 속도 또는 정확도에 맞춰 조정하는 발화 종료 감지입니다.
[제품]

이 TTS 모델은 좋은 모델일까요?
모델이 발전할수록 음성 합성 평가가 어려워지는 이유와 실제로 중요한 요소를 측정하는 방법을 살펴봅니다.
[연구]

Ink-2 소개: 음성 에이전트를 위한 1위 STT
실시간 음성 에이전트를 위한 음성 인식 모델 Ink-2를 출시합니다. Artificial Analysis 스트리밍 리더보드 1위이며 가장 정확한 내장 발화 종료 감지를 제공합니다.
[소식]

음성 AI 모델 선택 가이드
실험실이 아닌 실제 사용 사례를 기준으로 ASR, TTS, 발화 종료 감지 모델을 평가하는 실용적인 방법입니다.
[제품]

처음 배우는 음성 AI 용어
대화형 음성 AI를 이해하고 평가하고 만드는 데 필요한 핵심 용어 20개를 쉬운 말로 설명합니다.
[제품]

Mamba-3: 추론을 우선한 상태 공간 모델
Mamba-3는 현대적인 추론 워크로드를 중심으로 상태 공간 모델을 재설계합니다. 선형 모델의 장점인 낮은 지연시간을 유지하면서 품질을 높입니다.
[연구]

Cartesia에서 Claude 군단을 키울 소프트웨어 엔지니어를 찾습니다
코드 작성은 해결된 것 같습니다. 하지만 엔지니어링은 아직입니다. 그 간극을 메울 분을 찾습니다.
[엔지니어링]

Cartesia, GDPR 준수 달성
Cartesia의 음성 합성 플랫폼이 GDPR을 준수합니다. 데이터 보호, 개인정보 보호, 책임 있는 인간 중심 AI에 대한 약속을 이어갑니다.
[소식]

Line 소개: 현대적인 음성 에이전트 개발 플랫폼
Cartesia의 음성 에이전트 개발 플랫폼 Line을 소개합니다. 최고의 제품은 코드로 만든다는 생각에서 Line은 코드 중심으로 설계되었습니다.
[제품]

계층적 모델링
입력을 상위 개념으로 묶어 원시 데이터에서 직접 학습하고 토큰화의 한계를 넘는 계층적 아키텍처 H-Net을 소개합니다.
[연구]

Ink 소개: 실시간 대화를 위한 음성 인식 모델
실시간 음성 애플리케이션 개발자를 위한 스트리밍 음성 인식 모델군 Ink를 소개합니다. Ink-Whisper는 엔터프라이즈급 음성 에이전트에 맞춘 가장 빠르고 저렴한 STT 모델입니다.
[제품]

Organizations와 Dashboards 소개
음성 AI를 확장하는 개발자를 위해 Cartesia를 만들고 있습니다. 오늘 협업과 현황 파악을 돕는 두 기능, Organizations와 Dashboards를 소개합니다.
[제품]

Professional Voice Cloning 소개
Sonic으로 학습한 전문가 수준의 음성 복제 Professional Voice Cloning, PVC를 소개합니다. 이제 Startup+ 플랜에서 사용할 수 있습니다.
[제품]

Cartesia Python SDK v2.0.0
Python에서 Cartesia의 AI 음성 기능을 사용하는 개발 경험을 개선한 Python SDK v2.0.0을 출시합니다.
[엔지니어링]

Cartesia, Wing Venture Capital의 제7회 Enterprise Tech 30 선정
생성형 오디오 모델 제공업체 Cartesia가 성장 단계 전반에서 가장 유망한 비상장 기업 기술 회사를 선정하는 제7회 Enterprise Tech 30에 이름을 올렸습니다.
[소식]

시리즈 A와 음성 AI의 미래
Kleiner Perkins가 주도한 $64 million 시리즈 A 투자를 발표합니다. 새 투자금으로 팀을 확장하고 차세대 모델 개발을 위한 연구에 투자합니다.
[소식]

Llamba: 효율적인 언어 처리를 위한 증류 순환 모델 확장
앞으로 몇 년간 온디바이스 AI의 새 시대가 열릴 것입니다. 온디바이스 모델은 다양한 애플리케이션을 지원하게 됩니다.
[연구]

Cartesia로 음성 AI 에이전트 만드는 방법
아키텍처부터 프로덕션 배포까지, Cartesia Sonic 음성 합성으로 자연스럽고 지연 시간이 짧은 음성 AI 에이전트를 만드는 단계별 가이드입니다.
[엔지니어링]

2024 음성 AI 현황
첫 2024 State of Voice 보고서에서 산업을 발전시키는 인프라의 변화와 새 사용 사례를 살펴보고 2025년을 전망합니다.
[연구]

시드 투자 유치를 발표합니다
Index Ventures가 주도하고 Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel과 엔젤 투자자 90명이 참여한 $27M 시드 투자를 발표합니다.
[소식]

Cartesia의 해커톤 시즌
2024년 10월, Cartesia는 샌프란시스코 전역에서 개발자 2,000명 이상과 함께했습니다. Sonic으로 만든 창의적인 아이디어에 총 $20,000의 상금을 수여했습니다.
[엔지니어링]

Voice Changer 소개: 원하는 대로 오디오 바꾸기
Voice Changer는 원래의 표현, 감정, 운율을 유지하면서 오디오 클립의 목소리를 스튜디오급 음성이나 복제 음성으로 바꿉니다.
[제품]

Sonic Multilingual에 8개 언어 추가
Sonic Multilingual에서 힌디어, 이탈리아어, 한국어, 네덜란드어, 폴란드어, 러시아어, 스웨덴어, 튀르키예어의 알파 버전을 출시합니다.
[제품]

온디바이스 지능 업데이트
Cartesia는 어디서나 실행되는 상호작용형 지능, 누구나 곁에서 사용할 수 있는 차세대 AI를 만들고 있습니다.
[연구]

Sonic 발표: 사실적인 음성을 위한 저지연 음성 모델
오늘 사실적인 음성을 생성하는 저지연 음성 모델 Sonic을 출시합니다.
[연구]

Based: 회상 능력과 처리량의 균형을 잡는 단순한 선형 어텐션 언어 모델
Based는 프롬프트 처리에서 FlashAttention-2보다 56%, Mamba보다 44% 빠릅니다. 텍스트 생성 처리량은 FlashAttention-2보다 24배 높습니다.
[연구]

Mamba-3B-SlimPJ: 최고 수준의 Transformer에 견주는 상태 공간 모델
Cartesia 및 Together와 함께 지금까지 가장 강력한 Mamba 언어 모델 Mamba-3B-SlimPJ를 Apache 2.0 라이선스로 공개합니다.
[연구]
오늘 시작하세요
전문가와 상담하세요.
팀원과 연결해 Cartesia가 세계적 수준의 음성 경험을 만드는 데 어떻게 도움이 되는지 알아보세요.
개발을 시작하세요.
API로 모델을 사용하고 몇 분 만에 음성 에이전트를 프로덕션에 배포하세요.