Cartesia 是一家语音 AI 公司,向开发者出售实时语音模型和托管语音智能体平台,并自称是构建实时语音模型与智能体的 AI 实验室。Cartesia 主打用一个 API 完成语音生成、转写和生产级语音智能体,速度足以支撑实时对话。
产品线分三层。Cartesia Sonic 是文本转语音模型,Ink 是语音转文本模型,托管智能体则把两者与一个大语言模型结合,运行电话和应用内对话。声音克隆建立在 Sonic 之上;在付费 API 之外,还提供一款免费的浏览器变声器。
创始团队在斯坦福人工智能实验室读博时相识,他们称自己在那里发明了状态空间模型(SSM),也就是 Cartesia 用来替代标准 Transformer 的架构。公司把自身的速度和成本归功于 SSM,这是它自己的解释,并非实测结果。
Cartesia 提供两档 AI 声音克隆。即时声音克隆从 10 秒音频起即可创建,Sonic 3.6 及更新版本最多可使用 60 秒音频来保留口音,上传文件上限为 16 MB。专业声音克隆会用同一位说话人至少 30 分钟的音频微调模型,训练最长需要 3 小时。每个专业克隆一次只针对一种语言训练,因此多语种品牌声音需要为每种语言分别录制数据集。
托管智能体把 Ink-2、客户自选的 LLM 和 Sonic-3.6 组合成一个实时语音智能体,负责话轮交替、打断处理、音频流和工具调用。智能体可以使用三类工具:内置系统工具(例如结束通话)、向客户服务器发送请求的 webhook 工具,以及在已连接的浏览器、移动应用或服务器中运行的客户端工具。LLM 集成由 Cartesia 自己运行,因此无需另开模型提供商账号或 API 密钥。内置评估框架还提供实时测试、系统指标和自定义通话分析。
通过 API 创建专业声音克隆分四步:创建数据集,向其上传音频文件,基于该数据集创建微调任务,然后列出微调生成的声音。
Cartesia 给出的示例集中在电话智能体和用于媒体的克隆声音。
在规模方面,Cartesia 援引了 Bolna 的案例,称其借助 Cartesia 的低延迟基础设施,每天处理 50 万次以上、覆盖多种印度语言的语音通话;这是厂商发布的客户故事,而非独立审计。
Cartesia 适合把语音嵌入自家软件的团队,而不是想找现成消费级应用的人。
它不太适合需要 Ink 五种语言以外流式转写的团队、指望在 Free 套餐上使用声音克隆的人,以及需要可退款订阅的买家。
Cartesia 的语音模型按积分计费,智能体通话按美元计费,所有套餐都包含不限数量的工作区席位。以下为 2026 年 10 月 6 日采集的月付套餐:
| 套餐 | 月价 | 每月积分 | 预付智能体美元额度 | 套餐新增内容 |
|---|---|---|---|---|
| Free | $0 | 2 万 | $1 | 文本转语音和语音转文本访问权限 |
| Pro | $5 | 10 万 | $5 | 商用许可和即时声音克隆 |
| Startup | $49 | 125 万 | $49 | 包含 Pro 的全部内容,另加专业声音克隆 |
| Scale | $299 | 800 万 | $299 | 优先支持和高并发上限 |
| Enterprise | 定制 | 定制 | 定制 | 批量定价、定制并发、DPA 与 BAA、SSO |
在 Free、Pro、Startup 和 Scale 套餐上,Sonic-3.6 的额度约合每月 27、133、1,667 和 10,667 分钟,文本转语音并发请求数为 2、3、5 和 15。Ink-2 的额度约合 1 小时 51 分钟、9 小时 16 分钟、115 小时 44 分钟和 740 小时 44 分钟的转写时长,并发请求数为 8、12、20 和 60。
Cartesia 官网称其模型在一个第三方语音竞技场排行榜和语音转文本排行榜上排名第一。该独立竞技场基于盲听投票的提供商声音文本转语音排行榜,在 2026 年 10 月 6 日采集时把 Eleven v4 Turbo(Elo 1334)、Eleven v4(1321)和 Qwen-Audio-3.1-TTS-Plus(1292)排在 Sonic 3.6(1278)之前,Gemini 3.8 Flash TTS(1275)紧随其后。两种说法在当天并不相符,而且这项比较只涵盖该竞技场的提供商声音视图。
在转写方面,Cartesia 称 Ink-2 在电话线路录音、带口音的语音、嘈杂音频和财报电话会议上优于 Deepgram Flux、Soniox RT-V4、AssemblyAI RT Pro 和 ElevenLabs Scribe-2-realtime。这项基准测试由厂商自己完成,但它点明了 Cartesia 视为直接竞争对手的流式模型。
部分可以。AI 变声器无需注册即可免费试用;免费转换有每日上限,上传文件必须是 15 MB 以下的 WAV 或 MP3。
不会。只有成功的请求才会消耗积分,出错不收费。
可以,但要多一步。每个即时克隆都基于一种语言创建,因此要先用原始语言创建克隆,再通过“添加声音口音”API 加入其他语言。每添加一种声音口音消耗 225 积分。
Bytes 端点可以返回原始音频、WAV 或 MP3,而 SSE 和 WebSocket 端点只返回原始音频。支持的采样率为 8000 至 48000 Hz。
Cartesia 表示,其合规体系包括 SOC 2 Type II、HIPAA 资格(可为医疗客户提供 BAA)和 GDPR 合规,并为企业客户在符合条件的服务上提供零数据保留。