Toolso.AI
Toolso.AI
모든 도구카테고리인기최신 도구가격블로그
Toolso.AI
Toolso.AI

💌AI 도구 위클리 구독

매주 선별된 최신 및 핫한 AI 도구와 트렌드를 받은편지함으로 받아보세요 구독

Toolso.AI
Toolso.AI

생산성을 높일 최고의 AI 도구 발견

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

인기 카테고리

  • AI 글쓰기
  • AI 이미지
  • AI 비디오
  • AI 코딩
  • 더 많은 카테고리

탐색

  • 최신 도구
  • 인기 도구
  • 더 많은 도구
  • 도구 제출
  • 요금

회사 소개

  • 회사 소개
  • 문의하기
  • 블로그
  • 변경 로그

법률

  • 쿠키 정책
  • 개인정보 보호정책
  • 서비스 약관
  • 환불 정책
© 2026 Toolso.AI 모든 권리 보유
기간 한정기간 한정 프로모션추천 등록24시간 우선 심사 · 백링크 불필요 · 30일 추천 노출$29.90이후 $59.9010월 31일 이후 $59.90로 인상종료까지--:--:--지금 제출
  1. 홈
  2. 모든 도구
  3. 음성 기술
  4. Cartesia
Cartesia 인터페이스 미리보기
Cartesia 로고

Cartesia

Cartesia는 44개 언어를 지원하는 Sonic 텍스트 음성 변환, Ink 스트리밍 음성 인식, 음성 복제, 관리형 음성 에이전트를 하나의 API로 제공하며, 실시간 통화에 쓸 만큼 빠른 음성이 필요한 개발자를 위해 만들어졌습니다.

음성 기술개발 도구음성 생성#텍스트 음성 변환#음성 복제#실시간
가격 보기
저장
방문 횟수
조회수
가격
유료
출시일
2026년 10월 6일
도메인
cartesia.ai
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

Cartesia 제품 정보

가격 보기
도구 정보
저장
방문 횟수
조회수
가격
유료
출시일
2026년 10월 6일
도메인
cartesia.ai
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

추천 도구

관련 도구

가격 보기

Cartesia, 어떤 도구인가요?

Cartesia는 개발자에게 실시간 음성 모델과 관리형 음성 에이전트 플랫폼을 판매하는 음성 AI 기업으로, 스스로를 실시간 음성 모델과 에이전트를 만드는 AI 연구소라고 소개합니다. Cartesia는 음성 생성, 전사, 프로덕션 음성 에이전트를 하나의 API로 제공하며 실시간 대화에 쓸 만큼 빠르다는 점을 내세웁니다.

제품군은 세 층으로 이루어져 있습니다. Cartesia Sonic은 텍스트 음성 변환 모델, Ink는 음성 인식 모델이며, 관리형 에이전트는 이 둘을 대규모 언어 모델과 결합해 전화 통화와 앱 내 대화를 처리합니다. 음성 복제는 Sonic 위에서 동작하고, 유료 API와 별도로 무료 브라우저 음성 변조기도 제공됩니다.

창업팀은 스탠퍼드 AI 연구소에서 박사 과정을 밟으며 만났고, 그곳에서 상태 공간 모델(SSM)을 발명했다고 말합니다. SSM은 Cartesia가 표준 트랜스포머 대신 사용하는 아키텍처입니다. 회사는 자사의 속도와 비용을 SSM 덕분이라고 설명하지만, 이는 측정된 결과가 아니라 회사 자체의 설명입니다.

핵심 기능

Sonic 텍스트 음성 변환

  • 44개 언어: Sonic 3.6은 Cartesia의 가장 빠르고 가장 자연스러운 텍스트 음성 변환 모델로 소개되며, 44개 언어를 기본 지원합니다.
  • 지연 시간: Cartesia는 Sonic의 모델 지연 시간이 90ms 미만이라고 밝히며, 스트리밍을 쓰면 전체 응답이 생성되기 전에 재생을 시작할 수 있습니다.
  • 표현력 있는 전달: 기본적으로 Sonic은 원고에 담긴 감정의 속뜻을 읽어 전달 방식을 조정하며, 웃음 같은 비언어적 소리도 원고에 바로 적어 넣을 수 있습니다.
  • 발음 제어: 사용자 지정 발음 사전으로 고유 명사와 분야별 용어를 어떻게 읽을지 정할 수 있습니다.
  • 버전 고정: sonic-3.6 모델 ID는 항상 최신 안정 스냅샷을 가리키고, 날짜가 붙은 스냅샷은 공개된 뒤 바뀌지 않으며, sonic-preview는 프로덕션용이 아닌 베타 모델입니다.

Ink 음성 인식

  • 턴 감지 내장: Ink 2는 별도의 음성 활동 감지기가 필요 없습니다. 시작, 업데이트, 조기 종료, 재개, 종료 같은 턴 이벤트를 내보내 에이전트가 언제 듣고 언제 답할지 알려 주기 때문입니다.
  • 구조화된 데이터: Cartesia는 Ink가 스트리밍 음성 인식 모델 가운데 단어 오류율이 가장 낮고, 전화번호, 날짜, 이메일, 화폐, UUID를 기본적으로 처리한다고 말합니다.

음성 복제

Cartesia는 두 단계의 AI 음성 복제를 제공합니다. 즉시 음성 복제는 10초 분량의 오디오부터 만들 수 있고, Sonic 3.6 이상에서는 억양을 살리기 위해 최대 60초까지 쓸 수 있으며, 업로드 파일은 16MB로 제한됩니다. 전문 음성 복제는 한 화자의 오디오를 최소 30분 사용해 모델을 미세 조정하며, 학습에는 최대 3시간이 걸립니다. 전문 복제 하나는 한 번에 한 언어로만 학습되므로, 다국어 브랜드 음성을 만들려면 언어마다 데이터 세트를 따로 녹음해야 합니다.

관리형 에이전트

관리형 에이전트는 Ink-2, 고객이 고른 LLM, Sonic-3.6을 하나의 실시간 음성 에이전트로 묶어 말차례 교대, 끼어들기, 오디오 스트리밍, 도구 호출을 처리합니다. 에이전트가 쓸 수 있는 도구는 세 가지입니다. 통화 종료 같은 내장 시스템 도구, 고객 서버로 요청을 보내는 웹훅 도구, 연결된 브라우저나 모바일 앱, 서버에서 실행되는 클라이언트 도구입니다. LLM 연동은 Cartesia가 직접 운영하므로 별도의 모델 제공업체 계정이나 API 키가 필요하지 않습니다. 내장 평가 프레임워크는 실시간 테스트, 시스템 지표, 맞춤형 통화 분석을 더해 줍니다.

가이드

즉시 음성 복제 만들고 사용하기

  1. 본인의 목소리이거나 복제해도 된다는 명시적 허락을 받은 화자를 고릅니다.
  2. 음악, 메아리, 배경 소음이 없는 조용한 방에서 화자 한 명만 녹음하고, 복제 음성이 사용할 언어와 스타일로 말하게 합니다. 클립의 분위기는 즉시 복제 음성에 그대로 옮겨집니다.
  3. Playground에서 즉시 음성 복제를 열고 클립을 녹음하거나 업로드한 뒤 사용한 언어를 선택하거나, 복제가 애플리케이션의 일부라면 복제 API를 호출합니다.
  4. Playground에서 만들었든 API로 만들었든, 텍스트 음성 변환 요청에 해당 복제 음성의 음성 ID를 사용합니다.

API로 전문 음성 복제 학습하기

API로 전문 음성 복제를 만드는 과정은 네 단계입니다. 데이터 세트를 만들고, 오디오 파일을 업로드하고, 그 데이터 세트로 미세 조정 작업을 만든 다음, 미세 조정으로 생성된 음성 목록을 조회합니다.

Cartesia 활용 사례와 예시

Cartesia가 드는 예시는 전화 에이전트와 미디어용 복제 음성에 집중되어 있습니다.

  • 고객 지원: 에이전트가 발신자를 인증하고 실시간 계정 데이터를 불러와 청구 문의, 주문 상태, 계정 문제를 대기 시간이나 통화 전환 없이 해결합니다.
  • 채용: 에이전트가 지원자에게 바로 전화해 심사하고, 통화가 끝나기 전에 자격 요약을 지원자 추적 시스템에 넣습니다.
  • 사기 탐지: 에이전트가 의심 거래에 대해 실시간으로 확인 전화를 걸고 단계적 추가 인증을 처리합니다.
  • 게임: 스튜디오는 성우의 복제 음성으로 캐릭터 대사를 만들고, 이야기가 바뀌면 새 대사를 텍스트에서 바로 읽게 할 수 있습니다.
  • 더빙: 맞춤 음성이 지원되는 언어로 번역된 대본을 읽으며, 오디오를 영상에 넣기 전에 발음과 타이밍을 검토합니다.

규모의 예로 Cartesia는 Bolna를 들며, Bolna가 Cartesia의 저지연 인프라에서 여러 인도 언어로 하루 50만 건 이상의 음성 통화를 처리한다고 말합니다. 이는 독립 감사가 아니라 업체가 공개한 고객 사례입니다.

누구를 위한 것인가

Cartesia는 완성된 소비자용 앱을 찾는 사람보다 자체 소프트웨어에 음성을 넣는 팀에 맞습니다.

  • 초기 단계 기업: 지원 프로그램은 모든 단계의 스타트업을 받으며, 학생과 일회성 프로젝트는 사안별로 검토합니다. 선정된 스타트업은 12개월 동안 Scale 요금제를 쓰며, 매달 Sonic과 Ink가 함께 쓰는 크레딧 800만 개와 월 $299 상당의 관리형 에이전트 크레딧을 받습니다. 그 대가로 참가자는 자사 로고를 제공하고, Cartesia가 마케팅에 참가사의 이름과 로고를 쓰도록 허용합니다.
  • 규제 산업, 대량 사용, 공공 부문 구매자: 크레딧을 5,000만 개 넘게 쓰거나, 온프레미스·VPC·OEM 배포가 필요하거나, BAA나 데이터 무보존이 필요하거나, 정부 기관을 위해 구매하는 팀은 Cartesia가 영업팀으로 안내합니다.

Ink의 다섯 개 언어 밖에서 스트리밍 전사가 필요한 팀, Free 요금제에서 음성 복제를 기대하는 사람, 환불 가능한 구독이 필요한 구매자에게는 덜 맞습니다.

플랫폼

  • 브라우저 Playground: 모든 모델을 브라우저에서 써 볼 수 있으며, API 키도 이곳에서 만듭니다.
  • API 엔드포인트: Sonic 텍스트 음성 변환 API는 /tts/bytes, /tts/sse, /tts/websocket 세 엔드포인트로 제공됩니다.
  • SDK: 공식 SDK는 JavaScript/TypeScript와 Python으로 TTS, STT, 음성 API를 지원합니다.
  • 코딩 에이전트: Cartesia MCP는 Cursor, Claude Code 등 MCP 클라이언트에서 동작하며, 별도 스크립트 없이 음성 목록 조회, TTS와 STT 실행, 발음 사전 관리를 할 수 있습니다.
  • 에이전트 프레임워크: LiveKit 연동은 Cartesia 플러그인이나 LiveKit Inference를 통해 실시간 룸과 에이전트를 제공합니다. Pipecat은 음성 및 멀티모달 에이전트용 공식 Cartesia TTS·STT 서비스를 제공합니다.
  • 전화 연결: 에이전트는 Cartesia가 발급한 번호, Twilio에서 가져온 번호, SIP 통신사를 거쳐 라우팅되는 번호에 연결할 수 있습니다.
  • 배포: 클라우드 트래픽은 지역 API 엔드포인트를 거쳐 해당 지역 안에서 처리되며, 모델은 고객 데이터 센터나 맞춤 하드웨어에서도 실행할 수 있습니다. 엔터프라이즈 계약에서는 Sonic-3.6을 온프레미스(에어갭 환경 포함), AWS·GCP·Azure의 고객 VPC에 배포하거나 OEM 라이선스로 내장할 수 있습니다.
  • 마켓플레이스: Cartesia는 Sonic, Ink, 음성 에이전트를 모두 포함하는 구독 하나를 AWS Marketplace에서도 판매합니다.

가격

Cartesia는 음성 모델을 크레딧으로, 에이전트 통화를 달러로 청구하며, 모든 요금제에 워크스페이스 좌석이 무제한 포함됩니다. 2026년 10월 6일 확인한 월간 요금제는 다음과 같습니다.

요금제월 가격월 크레딧선불 에이전트 달러요금제에 추가되는 항목
Free$02만$1텍스트 음성 변환 및 음성 인식 이용
Pro$510만$5상업적 이용 라이선스 및 즉시 음성 복제
Startup$49125만$49Pro의 모든 기능에 전문 음성 복제 추가
Scale$299800만$299우선 지원 및 높은 동시 처리 한도
Enterprise맞춤맞춤맞춤대량 구매 가격, 맞춤 동시 처리, DPA 및 BAA, SSO

Free, Pro, Startup, Scale에서 Sonic-3.6 할당량은 월 약 27분, 133분, 1,667분, 10,667분에 해당하며, 텍스트 음성 변환 동시 요청 수는 2, 3, 5, 15개입니다. Ink-2 할당량은 전사 시간으로 대략 1시간 51분, 9시간 16분, 115시간 44분, 740시간 44분이며, 동시 요청 수는 8, 12, 20, 60개입니다.

  • 텍스트 음성 변환 과금: Sonic 오디오 1분에 750–800크레딧이 쓰입니다. 1크레딧이 1글자이기 때문입니다.
  • 음성 인식 과금: Ink-2는 오디오 1초당 3크레딧입니다. 요율은 모델과 배치·실시간 엔드포인트 여부에 따라 다르며, 전사 결과가 나오지 않아도 무음 구간이 과금됩니다.
  • 음성 에이전트: 통화는 분당 $0.06이며, Cartesia가 제공하는 전화번호를 쓰면 분당 $0.014가 추가됩니다. 선불 에이전트 달러는 관리형 전화번호 비용을 빼기 전 기준으로 Free에서 약 17분, Pro에서 1시간 23분, Startup에서 13시간 37분, Scale에서 83시간 3분 분량입니다.
  • 초과 사용: 유료 사용자는 초과 사용을 켤 수 있으며, 100만 크레딧당 Pro는 $65, Startup은 $45, Scale은 $38입니다. 초과 사용을 끄면 크레딧이 소진된 뒤 새 요청이 차단됩니다.
  • 이월: 사용하지 않은 크레딧은 월 요금제 할당량의 2배까지 이월됩니다.
  • 전문 음성 복제 슬롯: 전문 복제 학습은 무료이고 그 음성은 1글자당 1크레딧이 듭니다. Startup에는 슬롯 2개, Scale에는 4개가 포함되며 Free와 Pro에는 없습니다.
  • 갱신과 해지: 구독은 구매일부터 매월 갱신되며, 기간 중간에 해지하거나 다운그레이드해도 해당 기간이 끝날 때까지 기존 등급이 유지됩니다.
  • 환불: 약관에 달리 정한 경우를 제외하면 구독 결제는 환불되지 않으며, 일부만 사용한 기간에 대한 공제도 없습니다.

Cartesia 음성 합성·전사 대안

Cartesia 사이트는 자사 모델이 제3자 음성 아레나 리더보드와 음성 인식 리더보드에서 1위라고 말합니다. 그러나 2026년 10월 6일 확인한 그 독립 아레나의 제공업체 음성 텍스트 음성 변환 리더보드는 블라인드 청취 투표를 바탕으로 Eleven v4 Turbo(Elo 1334), Eleven v4(1321), Qwen-Audio-3.1-TTS-Plus(1292)를 Sonic 3.6(1278)보다 위에 두었고, Gemini 3.8 Flash TTS(1275)가 바로 뒤를 이었습니다. 두 주장은 그날 기준으로 일치하지 않았으며, 이 비교는 아레나의 제공업체 음성 보기에만 해당합니다.

전사 분야에서 Cartesia는 Ink-2가 전화 회선 녹음, 억양이 있는 음성, 잡음이 많은 오디오, 실적 발표 콜에서 Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro, ElevenLabs Scribe-2-realtime보다 낫다고 주장합니다. 이 벤치마크는 업체 자체 자료이지만, Cartesia가 직접 경쟁 상대로 보는 스트리밍 모델이 어떤 것인지는 보여 줍니다.

제한 사항

  • 복제 이용 조건이 서로 다름: 음성 복제 페이지는 복제에 유료 요금제가 필요하며, 즉시 음성 복제는 Pro부터, 전문 음성 복제는 Startup부터라고 안내합니다. 반면 Sonic FAQ는 Free 등급을 평가와 개인 용도로 설명하면서 즉시 음성 복제가 포함된다고 적고 있습니다. 같은 FAQ는 전문 음성 복제에 참조 오디오 15–30분이 필요하다고 하지만, 복제 문서는 30분을 최소 기준으로 정합니다.
  • 전문 복제의 속도와 음량 고정: 전문 음성 복제는 데이터 세트에서 말의 속도와 음량을 학습하므로, 요청 시 지정하는 속도·음량 제어가 적용되지 않습니다.
  • 전사 언어 다섯 개: Ink-2는 영어, 스페인어, 프랑스어, 힌디어, 일본어를 지원하며, Sonic의 44개 언어보다 훨씬 적습니다.
  • 에이전트 LLM 요금이 불분명함: 에이전트 LLM 문서는 2026년 10월 1일까지 LLM 사용이 무료라고 적고 있는데, 이는 이번 확인 시점보다 이전 날짜입니다. 가격 페이지는 여전히 UI로 만든 에이전트의 통화 중 LLM 사용을 한시적 무료로 표시합니다. 모델별 토큰 가격, 제공업체, 평균 지연 시간은 에이전트 모델 엔드포인트가 반환합니다.
  • 발급 번호는 미국만: Cartesia는 미국 전화번호만 발급하며, 다른 국가의 번호는 Twilio나 SIP 통신사를 통해 연결해야 합니다.
  • 통화 규정 준수는 고객 책임: 모든 통화, 문자, 사전 녹음 메시지가 전화소비자보호법과 전화 수신 거부 규정을 포함한 관련 법률을 지키도록 하는 책임은 전적으로 고객에게 있습니다.
  • 복제 안전장치의 과거와 현재: 2024년 12월 한 독립 IT 매체는 Sonic 음성 복제기에 눈에 띄는 안전장치가 거의 없고 서비스 약관 동의 체크박스 하나만 요구한다고 보도했습니다. 당시 Cartesia는 자동 및 수동 검토를 하고 있으며 음성 인증과 워터마킹을 준비 중이라고 밝혔습니다. 현재 Cartesia는 모든 음성 복제에 화자의 검증된 동의가 필요하고, 공인이나 동의하지 않은 타인의 음성 복제는 금지된다고 밝힙니다. 2026년 10월 6일 확인한 복제 관련 페이지 중 그 동의를 어떻게 검증하는지 설명한 곳은 없습니다.
  • 빈약한 리뷰 기반: 한 클라우드 마켓플레이스 등록 페이지는 2026년 10월 6일 확인 당시 평점 41개 기준 5점 만점에 4.3점을 표시했으나, 모두 외부 비즈니스 소프트웨어 리뷰 사이트에서 가져온 것이었고 마켓플레이스 자체에 남겨진 리뷰는 없었습니다.

개인정보, 데이터 사용, 음성 권리

  • 고객 콘텐츠로 학습: 별도 합의가 없으면 Cartesia는 입력, 출력, 사용자 상호작용을 모델 학습과 개선에 사용할 수 있습니다. 온라인 양식으로 자신의 콘텐츠 중 특정 범주를 제외할 수 있지만, 이 거부는 앞으로만 적용되며 이전 사용을 되돌리지는 않습니다.
  • 데이터 무보존: 데이터 무보존은 Enterprise 고객에게만 TTS·STT API에 대해 제공되며, 음성 복제, 전문 음성 복제, 음성 생성은 제외됩니다.
  • 앱의 고지 의무: Cartesia 기반 앱은 최종 사용자에게 사람이 아닌 AI와 대화하고 있다는 사실, 그리고 대화가 녹음되며 Cartesia와 제3자 LLM 제공업체에 공유될 수 있다는 사실을 알려야 합니다.
  • 상업적 이용: 구독 등급이 명시적으로 허용하지 않는 한 출력물을 상업적으로 사용할 수 없으며, 요금제 표에서 상업적 이용 라이선스는 Pro부터 시작됩니다.
  • 음성과 사칭 규칙: 허용 가능한 사용 정책은 유명인을 포함한 모든 개인이나 기업을 사칭하는 것을 금지하며, 본인 목소리나 명시적 동의를 받은 타인의 목소리만 허용합니다. 약관은 또한 명시적 허락 없이 고인이나 정치 후보자의 목소리를 게시하는 것을 금지합니다.
  • 미성년자와 정치: 출력물은 18세 미만인 사람과 관련되거나 그 사람을 나타내서는 안 됩니다. 정책은 정당한 정치 광고, 선거 운동, 로비, 모금도 허용하지 않습니다.

FAQ

Q1. 계정을 만들지 않고 Cartesia를 써 볼 수 있나요?

일부는 가능합니다. AI 음성 변조기는 가입 없이 무료로 써 볼 수 있으며, 무료 변환에는 하루 한도가 있고 업로드 파일은 15MB 미만의 WAV 또는 MP3여야 합니다.

Q2. 실패한 API 요청도 크레딧을 쓰나요?

아니요. 성공한 요청만 크레딧을 소모하며, 오류에는 요금이 부과되지 않습니다.

Q3. 복제한 음성이 다른 언어로 말할 수 있나요?

네, 단계가 하나 더 필요합니다. 즉시 복제는 각각 한 언어로 만들어지므로 먼저 원래 언어로 복제 음성을 만든 뒤, 음성 억양 추가 API로 다른 언어를 더합니다. 음성 억양을 하나 추가할 때마다 225크레딧이 듭니다.

Q4. Sonic은 어떤 오디오 형식을 반환하나요?

Bytes 엔드포인트는 원시 오디오, WAV, MP3를 반환할 수 있고, SSE와 WebSocket 엔드포인트는 원시 오디오만 반환합니다. 지원 샘플링 레이트는 8000~48000Hz입니다.

Q5. Cartesia는 SOC 2나 HIPAA를 준수하나요?

Cartesia는 자사 규정 준수 체계에 SOC 2 Type II, 의료 고객에게 BAA를 제공하는 HIPAA 적격성, GDPR 준수가 포함되며, 적격 서비스에서는 엔터프라이즈 고객에게 데이터 무보존을 제공한다고 밝힙니다.

비슷한 도구를 아시나요?
다른 훌륭한 AI 도구를 알고 계시다면 저희에게 제출해 주세요