Cartesia 是一家語音 AI 公司,向開發者銷售即時語音模型與代管式語音代理平台,並自稱為打造即時語音模型與代理的 AI 實驗室。Cartesia 主打用一個 API 完成語音生成、轉錄與正式上線等級的語音代理,速度足以應付即時對話。
產品線分成三層。Cartesia Sonic 是文字轉語音模型,Ink 是語音轉文字模型,代管代理則把兩者與一個大型語言模型結合,處理電話與應用程式內的對話。聲音複製建立在 Sonic 之上;付費 API 之外,另有一款免費的瀏覽器變聲工具。
創辦團隊在史丹佛人工智慧實驗室攻讀博士時相識,他們表示自己在那裡發明了狀態空間模型(SSM),也就是 Cartesia 用來取代標準 Transformer 的架構。公司把自身的速度與成本歸功於 SSM,這是它自己的解釋,並非實測結果。
Cartesia 提供兩種等級的 AI 聲音複製。即時聲音複製從 10 秒音訊起就能建立,Sonic 3.6 及更新版本最多可使用 60 秒音訊來保留口音,上傳檔案上限為 16 MB。專業聲音複製會用同一位說話者至少 30 分鐘的音訊微調模型,訓練最長需要 3 小時。每個專業複製一次只針對一種語言訓練,因此多語系品牌聲音需要為每種語言分別錄製資料集。
代管代理把 Ink-2、客戶自選的 LLM 與 Sonic-3.6 組成一個即時語音代理,負責話輪交替、插話處理、音訊串流與工具呼叫。代理可以使用三類工具:內建的系統工具(例如結束通話)、向客戶伺服器發送請求的 webhook 工具,以及在已連線的瀏覽器、行動應用程式或伺服器中執行的用戶端工具。LLM 整合由 Cartesia 自行運作,因此無需另外申請模型供應商帳號或 API 金鑰。內建評估框架還提供即時測試、系統指標與自訂通話分析。
透過 API 建立專業聲音複製分四步:建立資料集,把音訊檔案上傳到資料集,用該資料集建立微調工作,然後列出微調產生的聲音。
Cartesia 提供的範例集中在電話代理與用於媒體的複製聲音。
在規模方面,Cartesia 引用了 Bolna 的案例,表示對方透過 Cartesia 的低延遲基礎設施,每天處理 50 萬通以上、涵蓋多種印度語言的語音通話;這是廠商發布的客戶故事,而非獨立稽核。
Cartesia 適合把語音放進自家軟體的團隊,而不是想找現成消費型應用程式的人。
它比較不適合需要 Ink 五種語言以外串流轉錄的團隊、期待在 Free 方案就能使用聲音複製的人,以及需要可退款訂閱的買家。
Cartesia 的語音模型以點數計費,代理通話以美元計費,所有方案都包含不限數量的工作區席位。以下為 2026 年 10 月 6 日擷取的月繳方案:
| 方案 | 每月價格 | 每月點數 | 預付代理美元額度 | 方案新增內容 |
|---|---|---|---|---|
| Free | $0 | 2 萬 | $1 | 文字轉語音與語音轉文字使用權限 |
| Pro | $5 | 10 萬 | $5 | 商業使用授權與即時聲音複製 |
| Startup | $49 | 125 萬 | $49 | 包含 Pro 的所有內容,另加專業聲音複製 |
| Scale | $299 | 800 萬 | $299 | 優先支援與高並行上限 |
| Enterprise | 客製 | 客製 | 客製 | 大量採購定價、客製並行數、DPA 與 BAA、SSO |
在 Free、Pro、Startup 與 Scale 方案上,Sonic-3.6 的額度約等於每月 27、133、1,667 與 10,667 分鐘,文字轉語音並行請求數為 2、3、5 與 15。Ink-2 的額度約等於 1 小時 51 分、9 小時 16 分、115 小時 44 分與 740 小時 44 分的轉錄時間,並行請求數為 8、12、20 與 60。
Cartesia 官網表示其模型在一個第三方語音競技場排行榜與語音轉文字排行榜上排名第一。而該獨立競技場以盲聽投票為基礎的供應商聲音文字轉語音排行榜,在 2026 年 10 月 6 日擷取時把 Eleven v4 Turbo(Elo 1334)、Eleven v4(1321)與 Qwen-Audio-3.1-TTS-Plus(1292)排在 Sonic 3.6(1278)之前,Gemini 3.8 Flash TTS(1275)緊追在後。兩種說法在當天並不相符,而且這項比較只涵蓋該競技場的供應商聲音檢視。
在轉錄方面,Cartesia 表示 Ink-2 在電話線路錄音、帶口音的語音、嘈雜音訊與財報電話會議上勝過 Deepgram Flux、Soniox RT-V4、AssemblyAI RT Pro 與 ElevenLabs Scribe-2-realtime。這項基準測試是廠商自己做的,但它點出了 Cartesia 視為直接競爭對手的串流模型。
部分可以。AI 變聲工具不必註冊就能免費試用;免費轉換有每日上限,上傳檔案必須是 15 MB 以下的 WAV 或 MP3。
不會。只有成功的請求才會消耗點數,發生錯誤不收費。
可以,但要多一個步驟。每個即時複製都以一種語言建立,所以要先用原本的語言建立複製聲音,再透過「新增聲音口音」API 加入其他語言。每新增一種聲音口音收 225 點。
Bytes 端點可以傳回原始音訊、WAV 或 MP3,而 SSE 與 WebSocket 端點只傳回原始音訊。支援的取樣率為 8000 至 48000 Hz。
Cartesia 表示,其合規體系包括 SOC 2 Type II、HIPAA 資格(可為醫療客戶提供 BAA)與 GDPR 合規,並為企業客戶在符合條件的服務上提供零資料保留。