Cartesia는 개발자에게 실시간 음성 모델과 관리형 음성 에이전트 플랫폼을 판매하는 음성 AI 기업으로, 스스로를 실시간 음성 모델과 에이전트를 만드는 AI 연구소라고 소개합니다. Cartesia는 음성 생성, 전사, 프로덕션 음성 에이전트를 하나의 API로 제공하며 실시간 대화에 쓸 만큼 빠르다는 점을 내세웁니다.
제품군은 세 층으로 이루어져 있습니다. Cartesia Sonic은 텍스트 음성 변환 모델, Ink는 음성 인식 모델이며, 관리형 에이전트는 이 둘을 대규모 언어 모델과 결합해 전화 통화와 앱 내 대화를 처리합니다. 음성 복제는 Sonic 위에서 동작하고, 유료 API와 별도로 무료 브라우저 음성 변조기도 제공됩니다.
창업팀은 스탠퍼드 AI 연구소에서 박사 과정을 밟으며 만났고, 그곳에서 상태 공간 모델(SSM)을 발명했다고 말합니다. SSM은 Cartesia가 표준 트랜스포머 대신 사용하는 아키텍처입니다. 회사는 자사의 속도와 비용을 SSM 덕분이라고 설명하지만, 이는 측정된 결과가 아니라 회사 자체의 설명입니다.
Cartesia는 두 단계의 AI 음성 복제를 제공합니다. 즉시 음성 복제는 10초 분량의 오디오부터 만들 수 있고, Sonic 3.6 이상에서는 억양을 살리기 위해 최대 60초까지 쓸 수 있으며, 업로드 파일은 16MB로 제한됩니다. 전문 음성 복제는 한 화자의 오디오를 최소 30분 사용해 모델을 미세 조정하며, 학습에는 최대 3시간이 걸립니다. 전문 복제 하나는 한 번에 한 언어로만 학습되므로, 다국어 브랜드 음성을 만들려면 언어마다 데이터 세트를 따로 녹음해야 합니다.
관리형 에이전트는 Ink-2, 고객이 고른 LLM, Sonic-3.6을 하나의 실시간 음성 에이전트로 묶어 말차례 교대, 끼어들기, 오디오 스트리밍, 도구 호출을 처리합니다. 에이전트가 쓸 수 있는 도구는 세 가지입니다. 통화 종료 같은 내장 시스템 도구, 고객 서버로 요청을 보내는 웹훅 도구, 연결된 브라우저나 모바일 앱, 서버에서 실행되는 클라이언트 도구입니다. LLM 연동은 Cartesia가 직접 운영하므로 별도의 모델 제공업체 계정이나 API 키가 필요하지 않습니다. 내장 평가 프레임워크는 실시간 테스트, 시스템 지표, 맞춤형 통화 분석을 더해 줍니다.
API로 전문 음성 복제를 만드는 과정은 네 단계입니다. 데이터 세트를 만들고, 오디오 파일을 업로드하고, 그 데이터 세트로 미세 조정 작업을 만든 다음, 미세 조정으로 생성된 음성 목록을 조회합니다.
Cartesia가 드는 예시는 전화 에이전트와 미디어용 복제 음성에 집중되어 있습니다.
규모의 예로 Cartesia는 Bolna를 들며, Bolna가 Cartesia의 저지연 인프라에서 여러 인도 언어로 하루 50만 건 이상의 음성 통화를 처리한다고 말합니다. 이는 독립 감사가 아니라 업체가 공개한 고객 사례입니다.
Cartesia는 완성된 소비자용 앱을 찾는 사람보다 자체 소프트웨어에 음성을 넣는 팀에 맞습니다.
Ink의 다섯 개 언어 밖에서 스트리밍 전사가 필요한 팀, Free 요금제에서 음성 복제를 기대하는 사람, 환불 가능한 구독이 필요한 구매자에게는 덜 맞습니다.
Cartesia는 음성 모델을 크레딧으로, 에이전트 통화를 달러로 청구하며, 모든 요금제에 워크스페이스 좌석이 무제한 포함됩니다. 2026년 10월 6일 확인한 월간 요금제는 다음과 같습니다.
| 요금제 | 월 가격 | 월 크레딧 | 선불 에이전트 달러 | 요금제에 추가되는 항목 |
|---|---|---|---|---|
| Free | $0 | 2만 | $1 | 텍스트 음성 변환 및 음성 인식 이용 |
| Pro | $5 | 10만 | $5 | 상업적 이용 라이선스 및 즉시 음성 복제 |
| Startup | $49 | 125만 | $49 | Pro의 모든 기능에 전문 음성 복제 추가 |
| Scale | $299 | 800만 | $299 | 우선 지원 및 높은 동시 처리 한도 |
| Enterprise | 맞춤 | 맞춤 | 맞춤 | 대량 구매 가격, 맞춤 동시 처리, DPA 및 BAA, SSO |
Free, Pro, Startup, Scale에서 Sonic-3.6 할당량은 월 약 27분, 133분, 1,667분, 10,667분에 해당하며, 텍스트 음성 변환 동시 요청 수는 2, 3, 5, 15개입니다. Ink-2 할당량은 전사 시간으로 대략 1시간 51분, 9시간 16분, 115시간 44분, 740시간 44분이며, 동시 요청 수는 8, 12, 20, 60개입니다.
Cartesia 사이트는 자사 모델이 제3자 음성 아레나 리더보드와 음성 인식 리더보드에서 1위라고 말합니다. 그러나 2026년 10월 6일 확인한 그 독립 아레나의 제공업체 음성 텍스트 음성 변환 리더보드는 블라인드 청취 투표를 바탕으로 Eleven v4 Turbo(Elo 1334), Eleven v4(1321), Qwen-Audio-3.1-TTS-Plus(1292)를 Sonic 3.6(1278)보다 위에 두었고, Gemini 3.8 Flash TTS(1275)가 바로 뒤를 이었습니다. 두 주장은 그날 기준으로 일치하지 않았으며, 이 비교는 아레나의 제공업체 음성 보기에만 해당합니다.
전사 분야에서 Cartesia는 Ink-2가 전화 회선 녹음, 억양이 있는 음성, 잡음이 많은 오디오, 실적 발표 콜에서 Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro, ElevenLabs Scribe-2-realtime보다 낫다고 주장합니다. 이 벤치마크는 업체 자체 자료이지만, Cartesia가 직접 경쟁 상대로 보는 스트리밍 모델이 어떤 것인지는 보여 줍니다.
일부는 가능합니다. AI 음성 변조기는 가입 없이 무료로 써 볼 수 있으며, 무료 변환에는 하루 한도가 있고 업로드 파일은 15MB 미만의 WAV 또는 MP3여야 합니다.
아니요. 성공한 요청만 크레딧을 소모하며, 오류에는 요금이 부과되지 않습니다.
네, 단계가 하나 더 필요합니다. 즉시 복제는 각각 한 언어로 만들어지므로 먼저 원래 언어로 복제 음성을 만든 뒤, 음성 억양 추가 API로 다른 언어를 더합니다. 음성 억양을 하나 추가할 때마다 225크레딧이 듭니다.
Bytes 엔드포인트는 원시 오디오, WAV, MP3를 반환할 수 있고, SSE와 WebSocket 엔드포인트는 원시 오디오만 반환합니다. 지원 샘플링 레이트는 8000~48000Hz입니다.
Cartesia는 자사 규정 준수 체계에 SOC 2 Type II, 의료 고객에게 BAA를 제공하는 HIPAA 적격성, GDPR 준수가 포함되며, 적격 서비스에서는 엔터프라이즈 고객에게 데이터 무보존을 제공한다고 밝힙니다.