Toolso.AI
Toolso.AI
所有工具分类热门榜单最新工具价格博客
Toolso.AI
Toolso.AI

💌订阅 AI 工具周报

每周精选最新、最热门的AI工具和行业动态,直达您的邮箱 订阅

Toolso.AI
Toolso.AI

发现最好的AI工具,提升你的工作效率

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

热门分类

  • AI写作
  • AI图像
  • AI视频
  • AI编程
  • 更多分类

探索发现

  • 最新收录
  • 热门推荐
  • 更多工具
  • 提交工具
  • 价格

关于

  • 关于我们
  • 联系我们
  • 博客
  • 更新日志

法律

  • Cookie政策
  • 隐私政策
  • 服务条款
  • 退款政策
© 2026 Toolso.AI 保留所有权利
限时推广限时推广加速推广24h 优先审核 · 无需反链 · 30 天推荐展示$29.90到期后 $59.9010月31日后涨价至 $59.90距结束--:--:--立即提交
  1. 首页
  2. 所有工具
  3. 语音技术
  4. Cartesia
Cartesia界面预览
Cartesia标志

Cartesia

Cartesia 通过一个 API 提供支持 44 种语言的 Sonic 文本转语音、Ink 流式语音转文本、声音克隆和托管语音智能体,面向需要语音速度足以支撑实时通话的开发者。

语音技术开发工具语音生成#文字转语音#声音克隆#实时
查看定价
收藏
访问次数
浏览次数
定价
付费
发布日期
2026年10月6日
域名
cartesia.ai
用户评分

用过这个工具吗?给它评分

为这个工具评分

Cartesia 工具信息

查看定价
工具信息
收藏
访问次数
浏览次数
定价
付费
发布日期
2026年10月6日
域名
cartesia.ai
用户评分

用过这个工具吗?给它评分

为这个工具评分

推荐工具

相关工具推荐

查看定价

Cartesia 是什么?

Cartesia 是一家语音 AI 公司,向开发者出售实时语音模型和托管语音智能体平台,并自称是构建实时语音模型与智能体的 AI 实验室。Cartesia 主打用一个 API 完成语音生成、转写和生产级语音智能体,速度足以支撑实时对话。

产品线分三层。Cartesia Sonic 是文本转语音模型,Ink 是语音转文本模型,托管智能体则把两者与一个大语言模型结合,运行电话和应用内对话。声音克隆建立在 Sonic 之上;在付费 API 之外,还提供一款免费的浏览器变声器。

创始团队在斯坦福人工智能实验室读博时相识,他们称自己在那里发明了状态空间模型(SSM),也就是 Cartesia 用来替代标准 Transformer 的架构。公司把自身的速度和成本归功于 SSM,这是它自己的解释,并非实测结果。

核心功能

Sonic 文本转语音

  • 44 种语言:Sonic 3.6 被描述为 Cartesia 最快、最自然的文本转语音模型,原生支持 44 种语言。
  • 延迟:Cartesia 称 Sonic 的模型延迟低于 90 毫秒,流式输出可在完整响应生成前就开始播放。
  • 富有表现力的演绎:Sonic 默认会解读文稿中的情感潜台词并调整演绎方式,笑声等非语言声音也可以直接写进文稿。
  • 发音控制:自定义发音词典可设定专有名词和领域术语的读法。
  • 版本固定:sonic-3.6 模型 ID 始终指向最新的稳定快照,带日期的快照一经发布就不再改变,sonic-preview 则是测试版模型,不面向生产环境。

Ink 语音转文本

  • 内置轮次检测:Ink 2 不需要单独的语音活动检测器,因为它会发出轮次事件(开始、更新、提前结束、恢复和结束),告诉智能体何时倾听、何时回复。
  • 结构化数据:Cartesia 称 Ink 是所有流式语音转文本模型中词错误率最低的,并能原生处理电话号码、日期、电子邮件、货币和 UUID。

声音克隆

Cartesia 提供两档 AI 声音克隆。即时声音克隆从 10 秒音频起即可创建,Sonic 3.6 及更新版本最多可使用 60 秒音频来保留口音,上传文件上限为 16 MB。专业声音克隆会用同一位说话人至少 30 分钟的音频微调模型,训练最长需要 3 小时。每个专业克隆一次只针对一种语言训练,因此多语种品牌声音需要为每种语言分别录制数据集。

托管智能体

托管智能体把 Ink-2、客户自选的 LLM 和 Sonic-3.6 组合成一个实时语音智能体,负责话轮交替、打断处理、音频流和工具调用。智能体可以使用三类工具:内置系统工具(例如结束通话)、向客户服务器发送请求的 webhook 工具,以及在已连接的浏览器、移动应用或服务器中运行的客户端工具。LLM 集成由 Cartesia 自己运行,因此无需另开模型提供商账号或 API 密钥。内置评估框架还提供实时测试、系统指标和自定义通话分析。

使用指南

创建并使用即时声音克隆

  1. 选择一位声音归你所有、或你已获明确许可可以克隆其声音的说话人。
  2. 在安静的房间里只录制这一位说话人,不要有音乐、回声或背景噪音,并使用克隆将来要用的语言和风格;片段的情绪会带入即时克隆的声音。
  3. 在 Playground 中打开即时声音克隆,录制或上传片段并选择所说的语言;如果克隆是应用的一部分,则调用克隆 API。
  4. 在文本转语音请求中使用该克隆的声音 ID,无论该声音是在 Playground 中还是通过 API 创建的。

通过 API 训练专业声音克隆

通过 API 创建专业声音克隆分四步:创建数据集,向其上传音频文件,基于该数据集创建微调任务,然后列出微调生成的声音。

Cartesia 的使用场景与示例

Cartesia 给出的示例集中在电话智能体和用于媒体的克隆声音。

  • 客户支持:智能体验证来电者身份,调取实时账户数据,解决账单问题、订单状态和账户问题,无需等待或转接。
  • 招聘:智能体立即致电应聘者进行筛选,并在通话结束前把资格评估摘要推送到应聘者跟踪系统。
  • 欺诈检测:智能体针对可疑交易实时拨出验证电话,并处理加强身份验证。
  • 游戏:工作室可以用配音演员的克隆声音制作角色对白,并随剧情变化直接从文本读出新台词。
  • 配音:定制声音用支持的语言朗读翻译后的脚本,发音和时间节奏会在音频放进视频之前经过审核。

在规模方面,Cartesia 援引了 Bolna 的案例,称其借助 Cartesia 的低延迟基础设施,每天处理 50 万次以上、覆盖多种印度语言的语音通话;这是厂商发布的客户故事,而非独立审计。

适用人群

Cartesia 适合把语音嵌入自家软件的团队,而不是想找现成消费级应用的人。

  • 早期公司:一项资助计划接受任何阶段的初创公司,学生和一次性项目则逐案考虑。获批的初创公司可获得 12 个月的 Scale 套餐,每月含 800 万 Sonic 与 Ink 共用积分,另加每月 $299 的托管智能体额度。作为回报,参与者需提供自己的标志,并允许 Cartesia 在营销中使用其名称和标志。
  • 受监管、高用量和公共部门买家:当团队用量超过 5000 万积分,需要本地、VPC 或 OEM 部署,需要 BAA 或零数据保留,或者为政府采购时,Cartesia 会引导他们联系销售。

它不太适合需要 Ink 五种语言以外流式转写的团队、指望在 Free 套餐上使用声音克隆的人,以及需要可退款订阅的买家。

支持平台

  • 浏览器 Playground:所有模型都可以在浏览器中试用,API 密钥也在这里创建。
  • API 端点:Sonic 文本转语音 API 通过三个端点提供,即 /tts/bytes、/tts/sse 和 /tts/websocket。
  • SDK:官方 SDK 以 JavaScript/TypeScript 和 Python 覆盖 TTS、STT 和声音 API。
  • 编程智能体:Cartesia MCP 可在 Cursor、Claude Code 和其他 MCP 客户端中使用,无需自定义脚本即可列出声音、运行 TTS 和 STT,以及管理发音词典。
  • 智能体框架:LiveKit 集成通过 Cartesia 插件或 LiveKit Inference 提供实时房间和智能体。Pipecat 为语音和多模态智能体提供官方的 Cartesia TTS 与 STT 服务。
  • 电话接入:智能体可以连接 Cartesia 开通的号码、从 Twilio 导入的号码,或经 SIP 运营商路由的号码。
  • 部署:云端流量经区域 API 端点在区域内处理,模型也可以在客户的数据中心或定制硬件上运行。在企业合同下,Sonic-3.6 可以本地部署(包括物理隔离的站点)、部署在客户位于 AWS、GCP 或 Azure 上的 VPC 中,或通过 OEM 授权嵌入。
  • 应用市场:Cartesia 还通过 AWS Marketplace 销售一个涵盖 Sonic、Ink 和语音智能体的订阅。

价格套餐

Cartesia 的语音模型按积分计费,智能体通话按美元计费,所有套餐都包含不限数量的工作区席位。以下为 2026 年 10 月 6 日采集的月付套餐:

套餐月价每月积分预付智能体美元额度套餐新增内容
Free$02 万$1文本转语音和语音转文本访问权限
Pro$510 万$5商用许可和即时声音克隆
Startup$49125 万$49包含 Pro 的全部内容,另加专业声音克隆
Scale$299800 万$299优先支持和高并发上限
Enterprise定制定制定制批量定价、定制并发、DPA 与 BAA、SSO

在 Free、Pro、Startup 和 Scale 套餐上,Sonic-3.6 的额度约合每月 27、133、1,667 和 10,667 分钟,文本转语音并发请求数为 2、3、5 和 15。Ink-2 的额度约合 1 小时 51 分钟、9 小时 16 分钟、115 小时 44 分钟和 740 小时 44 分钟的转写时长,并发请求数为 8、12、20 和 60。

  • 文本转语音计量:一分钟 Sonic 音频消耗 750–800 积分,因为 1 积分等于 1 个字符。
  • 语音转文本计量:Ink-2 每秒音频消耗 3 积分。费率取决于模型及批量或实时端点;即使没有返回转写结果,静音也会计费。
  • 语音智能体:通话每分钟 $0.06,使用 Cartesia 提供的电话号码时每分钟另加 $0.014。预付的智能体美元额度约够 Free 用 17 分钟、Pro 用 1 小时 23 分钟、Startup 用 13 小时 37 分钟、Scale 用 83 小时 3 分钟,未计托管电话号码费用。
  • 超额用量:付费用户可以开启超额用量,Pro 为每 100 万积分 $65,Startup 为 $45,Scale 为 $38;关闭超额用量时,积分用完后新请求会被阻止。
  • 结转:未用完的积分可以结转,上限为套餐月额度的 2 倍。
  • 专业声音克隆名额:训练专业克隆免费,其语音按每个字符 1 积分计费;Startup 含 2 个名额,Scale 含 4 个,Free 和 Pro 不含名额。
  • 续订与取消:订阅从购买日起按月续订;在周期中途取消或降级后,账户会保留原等级直到该周期结束。
  • 退款:除条款另有规定外,订阅付款不予退款,部分使用的周期也不会折算抵扣。

Cartesia 的语音合成与转写替代方案

Cartesia 官网称其模型在一个第三方语音竞技场排行榜和语音转文本排行榜上排名第一。该独立竞技场基于盲听投票的提供商声音文本转语音排行榜,在 2026 年 10 月 6 日采集时把 Eleven v4 Turbo(Elo 1334)、Eleven v4(1321)和 Qwen-Audio-3.1-TTS-Plus(1292)排在 Sonic 3.6(1278)之前,Gemini 3.8 Flash TTS(1275)紧随其后。两种说法在当天并不相符,而且这项比较只涵盖该竞技场的提供商声音视图。

在转写方面,Cartesia 称 Ink-2 在电话线路录音、带口音的语音、嘈杂音频和财报电话会议上优于 Deepgram Flux、Soniox RT-V4、AssemblyAI RT Pro 和 ElevenLabs Scribe-2-realtime。这项基准测试由厂商自己完成,但它点明了 Cartesia 视为直接竞争对手的流式模型。

注意事项

  • 克隆权限说法冲突:声音克隆页面称克隆需要付费套餐,即时声音克隆从 Pro 起提供,专业声音克隆从 Startup 起提供。Sonic 常见问题却把 Free 套餐描述为用于评估和个人使用,并包含即时声音克隆。同一份常见问题称专业声音克隆需要 15–30 分钟参考音频,而克隆文档把 30 分钟定为最低要求。
  • 专业克隆的语速和音量固定:专业声音克隆会从数据集中学习节奏和响度,因此请求时的语速和音量控制对它不起作用。
  • 五种转写语言:Ink-2 支持英语、西班牙语、法语、印地语和日语,远少于 Sonic 的 44 种。
  • 智能体的 LLM 费用不明确:智能体 LLM 文档写明 LLM 可免费使用至 2026 年 10 月 1 日,这个日期早于本次采集。价格页面仍将通话期间的 LLM 使用列为对界面创建的智能体限时免费。各模型的 token 价格、提供商和平均延迟由智能体模型端点返回。
  • 开通号码仅限美国:Cartesia 只开通美国电话号码;其他国家的号码需通过 Twilio 或 SIP 运营商接入。
  • 通话合规责任在客户:客户须独自负责让每一通电话、每一条短信或预录消息都符合适用法律,包括《电话消费者保护法》和“请勿来电”规则。
  • 克隆防护措施的过去与现在:2024 年 12 月,一家独立 IT 媒体报道称,Sonic 声音克隆器几乎看不到明显的防护措施,只要求勾选同意服务条款;Cartesia 当时表示已有自动和人工审核,并正在开发声音验证和水印。Cartesia 现在表示,所有声音克隆都需要说话人经过验证的同意,并禁止克隆公众人物或未经同意克隆他人。2026 年 10 月 6 日采集的克隆页面都没有说明这种同意如何验证。
  • 评价基础薄弱:一个云市场的产品页在 2026 年 10 月 6 日采集时显示,41 条评分的平均分为 4.3 分(满分 5 分),全部从一个外部商业软件评测网站导入,该市场本身没有用户留下评价。

隐私、数据使用与声音权利

  • 用客户内容训练:除非另有约定,Cartesia 可能使用输入、输出和用户交互来训练和改进其模型。用户可以通过在线表单排除自己内容中的特定类别,但退出只对今后生效,不会撤销此前的使用。
  • 零数据保留:零数据保留仅向 Enterprise 客户提供,适用于 TTS 和 STT API,且不包括声音克隆、专业声音克隆和声音创建。
  • 应用的告知义务:基于 Cartesia 构建的应用必须告知终端用户,他们是在与 AI 而不是真人交谈,并且对话会被录音,可能会与 Cartesia 及其第三方 LLM 提供商共享。
  • 商业使用:除非订阅等级明确允许,否则输出不得用于商业用途;在套餐表中,商用许可从 Pro 起提供。
  • 声音与冒充规则:《可接受使用政策》禁止冒充任何人(包括名人)或任何企业,只允许使用你自己的声音,或经明确同意的他人声音。条款还禁止在未获明确许可的情况下发布已故人士或政治候选人的声音。
  • 未成年人与政治:输出不得涉及或代表任何未满 18 岁的人。该政策还排除了正当的政治广告、竞选、游说和筹款。

FAQ

Q1. 不注册账号可以试用 Cartesia 吗?

部分可以。AI 变声器无需注册即可免费试用;免费转换有每日上限,上传文件必须是 15 MB 以下的 WAV 或 MP3。

Q2. 失败的 API 请求会消耗积分吗?

不会。只有成功的请求才会消耗积分,出错不收费。

Q3. 克隆的声音能说其他语言吗?

可以,但要多一步。每个即时克隆都基于一种语言创建,因此要先用原始语言创建克隆,再通过“添加声音口音”API 加入其他语言。每添加一种声音口音消耗 225 积分。

Q4. Sonic 返回哪些音频格式?

Bytes 端点可以返回原始音频、WAV 或 MP3,而 SSE 和 WebSocket 端点只返回原始音频。支持的采样率为 8000 至 48000 Hz。

Q5. Cartesia 是否符合 SOC 2 或 HIPAA?

Cartesia 表示,其合规体系包括 SOC 2 Type II、HIPAA 资格(可为医疗客户提供 BAA)和 GDPR 合规,并为企业客户在符合条件的服务上提供零数据保留。

发现类似工具?
如果你知道其他优秀的AI工具,欢迎提交给我们