Voice.ai 是一个语音技术平台,运营主体为美国公司 Voice AI, Inc.,其站点每一页的页脚都标注 Voice.ai® 与 Voice Universe® 为注册商标。这个产品最初的形态比今天窄得多:它是一个桌面应用,让游戏玩家和主播在 Discord 或游戏语音频道里说话时实时替换自己的音色。那个最初的实时变声器至今仍在,也仍然是多数人访问这个域名的原因。但平台如今在同一个账号下售卖四类不同的东西,而弄清自己真正需要哪一类,是注册之前最值得先想明白的事。
这四条产品线分别是实时变声器、文字转语音引擎、即时声音克隆,以及电话语音代理。官网首页标题把其中两条并排放在一起——「免费 AI 变声器与语音代理平台」——这是一个相当罕见的组合,因为这两类受众几乎没有交集。一边是想在 Minecraft 服务器里听起来像卡通角色的少年,另一边是希望凌晨三点的销售来电也有人接的运营主管。Voice.ai 用同一套代码和同一份积分余额服务两者,这种双重身份解释了这个产品用起来的许多感受。
公司对自身技术路线的界定,比「我们能复制任何声音」要更窄也更有意思。创始人兼 CEO Heath Ahrens 对 TechCrunch 的表述是:其语音到语音 AI 的核心价值主张并不是完美复制某个特定的人,而是在替换音色的同时保留说话者语音中的核心要素——情绪、节奏与重音——从而实时生成一个全新的结果。这是有意与那些把「还原度」作为全部卖点的语音转换公司拉开距离。Voice.ai 优化的目标是转换后听起来自然且能实时进行,而不是克隆结果在鉴定意义上难以分辨。
创始团队的背景对理解这家公司的主张是有帮助的。Ahrens 于 2007 年创办 iSpeech,官网 About 页称其为首个云端文字转语音平台,并在 2009 年推出 DriveSafe.ly,这是第一个把短信朗读出来的应用。他此前还创办过人脸识别公司 Haystack。一位做了近二十年语音接口的创始人,会让这家公司近期转向开发者 API 与企业语音代理这件事,看起来不像是转型,更像是回到主场。
有两个数字可以给出规模感,但两者都有明确时点。TechCrunch 在 2023 年 6 月报道其首轮外部融资时,Voice.ai 拥有超过 48 万用户和超过 5 万个声音滤镜,此前完全靠口碑增长和 300 万美元自筹资金支撑,Discord 社群超过 12 万人。当时 Mucker Capital 与 M13 领投了 600 万美元,M13 至今仍将其列为种子阶段被投项目。而当前的 App Store 页面描述的是一个超过 2 万个用户生成声音的社区库。这些数字统计的是不同时点的不同对象,不应被拼接成一条趋势线。
真正让 Voice.ai 区别于常规文字转语音厂商的一点是:它的声音库在很大程度上并不属于它自己。Voice Universe 是一个社区库,用户把自己制作的声音上传进去,其他用户再从中取用。这个名字被注册为商标,足以说明它在公司身份认同中的位置。这种形态更接近一个交易市场或模组社区,而不是一份经过策展的官方音色目录,它同时带来了这个平台最大的优势和最棘手的问题。
优势是广度与速度。一个由数万名贡献者共建的目录,其增长速度和长尾覆盖是任何内部录音棚都难以企及的。问题则出在质量方差与来源合法性上。因为任何人都可以贡献,质量参差不齐;有第三方评测者观察到音质普遍发飘,而所谓的动漫少女音色不少其实只是做了音高调整。又因为上传物由用户生成,「每个声音是否获得当事人同意」这个问题落在上传者身上而非平台身上,这也正是服务条款要花大量篇幅处理这个问题的原因。
实时变声是最初的产品,也是要求最高的一项。在桌面端它以 Live Mode 的形式运行,在本机显卡上完成语音处理,再通过 Ahrens 所说的「虚拟音频线」把变换后的音频送入其他应用。这种本地处理架构是延迟低到足以支撑对话的原因,同时也意味着硬件门槛是实打实的而非象征性的。
官方 FAQ 在这件事上罕见地坦率。它设有一个专门条目叫「使用 Live Mode 所需的最低 GPU 是什么?」,另有一条独立的警告消息条目「警告!您的 GPU 不支持 Live Mode!」。厂商不会为一种硬件故障模式专门撰写文档化的错误提示,除非撞上它的用户数量相当可观。有第三方评测指出,显卡低于 Nvidia GTX 980 或 AMD RX 580 这一档的机器会出现卡顿与音频撕裂,并引述一位用户发现该应用占用了其百分之八十七的显卡资源。把 Live Mode 当作一项有硬件下限的功能来看待,而不是一项人人可用的通用能力。
文字转语音引擎是平台近期投入最重的部分,也是定价模型中的主要计量对象。官网称支持超过 15 种语言,并逐一列出:英语(美式)、法语、印地语、乌克兰语、日语、韩语、瑞典语、西班牙语(拉美)、葡萄牙语(巴西)、中文、荷兰语、土耳其语、德语与意大利语。官方表述的目标是把一个既定音色本地化到任意口音或语言,也就是说音色身份与语种被当作可分离的两个维度处理。
付费档补上了免费档所扣留的若干实用必需项。免费档单次转换上限为 500 字符,大约相当于一个短段落;Starter 档把上限提到 5,000 字符,并且关键性地解锁了下载生成文件这一动作本身。此外还有一个更轻量的入口叫 TTS Lite,在站点导航中标注为新增;Starter 档起还包含一个 Text to Speech Studio。
声音克隆被做成了按档位分配的配额,而不是一项无限量的能力,这让我们很容易读出公司预期每类客户会用到多少。免费档明确写着「无即时声音克隆」。Starter 档含 5 个,Launch 档 10 个,Core 档 50 个,Scale 档 200 个,Business 档则达到 2,200 个。这道配额阶梯是判断每一档面向谁设计的最清晰信号之一。
有一个细节值得特别标出,因为官网自己的两个页面互相矛盾。首页称只需 10 秒音频即可以惊人的真实度复制声音,而专门的声音克隆页写的是仅需 15 秒即可完成克隆。两者都是同一时间发布的官方表述,彼此没有交叉引用,也没有对这个差距作出任何说明。建议按较长的那个数字来规划,把较短的那个视为营销口径的下限而非技术规格。
语音代理是最新的一条产品线,也是当前承载商业重量最大的一条,它排在站点导航第一位并标注为新增。其主张是让代理接管呼入与呼出电话,使企业不再漏接;公司的描述是代理可以自动拨打与接听电话、回答问题、预约日程并端到端管理整段对话。点名的集成对象包括 Salesforce、HubSpot、Zendesk 与 Slack。
让这条产品线显得可信而非只是一个落地页的,是它按电话业务特有的单位来计量。套餐之间的差异体现在并发通话数与电话号码数量上:Starter 档 2 路并发、1 个号码,Launch 档 4 路、3 个号码,Core 档 8 路、10 个号码,Scale 档 16 路、20 个号码,Business 档则是 30 路并发与 50 个号码。这些是真实呼叫平台才会有的约束,不是演示品的参数。
在四条主线之外,站点还托管了九个免费的浏览器端音频工具:文字转语音、在线变声器、音频增强、人声移除、回声移除、AI 分轨、歌曲调性与 BPM 检测、混响移除,以及音频格式转换。它们的作用更像获客入口而不是业务线,并且同样通过积分计量:免费档限制单次处理 5 分钟,随档位逐级上升至 180 分钟。
API 是一条真实的产品线而非一句承诺,证据在细节而不在宣称。开发者页面暴露了三类接口——文字转语音、语音代理与声音克隆——对应的是位于 dev.voice.ai/api/v1/tts/speech 的真实端点,可运行的 Python 示例中带有具名模型标识 voiceai-tts-v1-latest。配套提供 Python 与 TypeScript 两套 SDK 以及 REST 示例,覆盖网页、iOS 与 Android,并声明兼容 LiveKit 与 Pipecat 这两个实时语音工程师真正在用的开源框架。
平台宣传对话交互的响应时间低于 150 毫秒。这是厂商自报数字,公布时未附测试条件,也没有第三方基准,因此应当视为设计目标而非已验证的实测值。部署形态提供四种:云托管 API、本地私有化部署、位于客户自有 VPC 的私有云,以及低延迟本地部署。API 另支持 MCP 兼容的代理工作流、用于动态知识接入的 RAG 集成、工具调用,以及在音频生成完成、代理响应回调、会话状态更新、错误与重试通知等时机触发的 webhook。
有一个前置条件很容易被忽略,而发现得晚代价不小。服务条款写明,商业、企业、API 或其他商业用途需要与 Voice.ai 另行签署协议。从自助流程里拿到一个 API key,并不等于已经在合同层面获准以此发布产品。
游戏、直播与虚拟主播。 这是平台的历史核心,至今仍是其最大的真实受众。TechCrunch 描述其被游戏玩家、内容创作者与虚拟主播广泛采用,覆盖 TikTok、Zoom、Discord、Minecraft、GTA5、Fortnite、Valorant、英雄联盟、Among Us、Skype 与 WhatsApp。官方 FAQ 则以逐个应用的接入排障条目佐证了这一点,涵盖 Discord、Skype、WhatsApp、Zoom、PUBG、Fortnite、Google Meet、英雄联盟、魔兽世界、Among Us、Minecraft、TeamSpeak、Telegram 与 Viber。如果你的使用场景在这份清单里,说明已经有人替你把故障模式记录下来了。
呼入与呼出电话处理。 语音代理这条线瞄准的是那些因漏接电话而流失线索的企业。并发数与号码数的分档让规模评估可以做得比较诚实:一家正在试水的单点门店完全装得进 Starter 档的 2 路并发,而需要 50 个号码的运营规模则属于 Business 档的范畴。
配音与旁白制作。 声音克隆页点名了播客、电子游戏与专业配音三类场景,并称可以在不开口说话的情况下生成数千小时的配音内容。真正让这件事可行的门槛在 Starter 档,因为文件下载与商用许可是从这一档才开始提供的——没有下载能力,免费档无法接入任何真实的生产流程。
多语种本地化。 由于音色身份与语种被当作可分离的维度,同一个音色可以在十四个具名语言之间做口音或语种的本地化。对于需要在多个市场维持同一套频道人设的创作者而言,这比每种语言各挑一个不相干的库存音色要有用得多。
无障碍与身份表达。 伦理页明确点名了两个群体。它称这项技术能让跨性别群体在不进行嗓音训练或医疗介入的前提下获得自己期望的声音,并称对于因喉癌、渐冻症或帕金森病等疾病而失声的人群,本产品相较传统文字转语音是一种潜在的改进。TechCrunch 独立佐证了前一类用户,并将其与出于隐私保护的用户、以及探索全新线上人格的用户并列为新兴群体。
出于隐私考虑的声音遮蔽。 这是与娱乐用途截然不同的一类需求:有人希望参与语音聊天但不暴露自己的真实嗓音。公司「保留情绪与节奏、只替换音色」的技术取向,恰好比机械式滤波器更适合这个目的。
为克隆录制干净的素材。 克隆质量的上限由源素材决定。一个安静的房间、与麦克风保持稳定的距离、以及朗读自然语句而非孤立词表,得到的模型明显优于在背景噪音中录下的短片段。
给克隆的素材长度留出余量。 鉴于官网自己给出的两个最低时长(10 秒与 15 秒)互相矛盾,应把它们都当作下限看待。更长、语音内容更多样的样本能给模型更充分的音素覆盖。
是否公开自己声音的克隆,要慎重决定。 上传意味着这个声音会进入一个供他人取用的库。Comparitech 给出的核心安全建议就是不要上传基于本人声音训练的模型,理由是它可能被他人用于语音诈骗——同时该文也说明这是声音克隆类平台的共性问题,并非本产品独有。在假定某个克隆是私有的之前,请先检查账号的可见性设置。
检查 metamodel 训练开关。 条款写明使用服务即表示同意公司将你的硬件用于 metamodel 训练与计算,并称所有用户可随时关闭该功能。条款没有说明这个开关默认是开还是关,因此请自行核实,不要想当然。
如果一边打游戏一边变声,要给显卡留余量。 Live Mode 与游戏争抢同一块显卡。在一块本就吃紧的显卡上,结果会是游戏掉帧和音频失真同时发生。
订阅之前就核实,而不是之后。 多位独立评测者批评的是同一件事:安装完成之前看不到价格。既然定价页本身是公开且详细的,那就在安装任何东西之前,先在浏览器里把它读一遍。
保存第三方声音的授权凭证。 如果你克隆了他人的声音,条款要求取得该人的明确法律授权,而赔偿条款把出错的后果放在了用户身上。留存书面许可,是这项要求在实务中的具体形态。
不要用产出物去搭建竞品语音产品。 条款明确禁止利用其输出去训练、开发或改进任何语音模型,禁止用于构建新的合成声音或衍生产品,也禁止用于支持竞争性产品。
拥有合格硬件的游戏玩家、主播与虚拟主播 是实时能力一侧最契合的受众。如果你有一块中端或更好的游戏显卡,并且常泡在 Discord 或多人语音里,这里就是这个产品的主场,社区声音库在这一领域也最为丰富。
中等产量的配音内容创作者 从 Starter 档起就能得到较好的支撑,因为下载与商用许可从这一档开始提供。十四个具名语言使它对跨市场发布的创作者具备现实可行性。
正在流失呼入电话的小型企业 是语音代理这条线的目标客户。较低档位把一次真实试点的成本压到了可承受范围——每月 5 美元获得 1 个号码与 2 路并发,是在正式投入之前验证自动接听是否适合自身业务的现实做法。
构建实时语音功能的开发者 可以拿到一套有文档、有具名 SDK 与框架兼容性的 API,前提是按条款要求另行签署商业协议。
因身份认同或无障碍需求而需要另一个声音的人群,在伦理页中被明确提及,TechCrunch 也独立地把这一类识别为增长中的用户群体。
不建议选用的情况: 使用核显或老旧笔记本却想要实时变声的人,因为没有任何套餐能补偿硬件下限;需要在合同上确保产出物权属与不侵权的人,因为条款恰恰对此作出免责;以及无法接受严格的不可退款政策的人。
桌面应用是功能最完整的客户端,也是唯一能运行 Live Mode 实时变换的地方,通过官网自有的安装包分发。它的能力上限由机器显卡决定,而不仅仅由订阅档位决定。
网页端覆盖文字转语音、语音代理控制台与九个在线音频工具,因为处理发生在服务端,所以对本地硬件没有要求。这是做前期评估最合适的入口。
移动端方面,iOS 应用由 Voice AI Inc. 发布。根据苹果官方接口数据,其评分为 4.0 分、共 189 条评分,内容分级 12+,免费下载,要求 iOS 18.0 或更高版本,首次发布于 2023 年 5 月,2026 年 7 月更新至 2.0.5 版。有一处能力差距被公司自己的 FAQ 记录在案:其中设有「能否用手机版做实时变声」与「为什么手机版还没有实时变声」两个条目,因此移动端与桌面端并不对等。TechCrunch 在 2023 年的报道曾描述其覆盖 Mac、PC、Android 与 iOS;而当前官网的下载入口呈现的是 Windows 安装包与 App Store 链接,安卓端的现状在撰写时无法从官方渠道确认,建议直接查看官网。
程序化接入方面,API 覆盖网页、iOS 与 Android,部署形态包括云托管、本地私有化、客户自有 VPC 私有云,以及低延迟本地部署。
定价在官网定价页公开,结构为按月积分额度计量的七个档位,年付标注为赠送两个月。
| 档位 | 月费 | 每月积分 | 即时声音克隆 | 并发通话 | 电话号码 |
|---|---|---|---|---|---|
| Free | $0 | 5k | 无 | — | — |
| Starter | $5 | 15k | 5 | 2 路 | 1 个 |
| Launch | $24(首月 $12) | 200k | 10 | 4 路 | 3 个 |
| Core | $99 | 1M | 50 | 8 路 | 10 个 |
| Scale | $330 | 4M | 200 | 16 路 | 20 个 |
| Business | $880 | 22M | 2,200 | 30 路 | 50 个 |
| Enterprise | 定制 | 定制 | — | — | — |
积分体系是真正值得理解清楚的部分,因为积分是一种跨能力共用的单位,在不同能力上按不同汇率消耗。在 Core 档上,同样的一百万积分可以换成 1,000 分钟文字转语音,或 1,000 分钟语音代理通话,或 15,000 分钟音频工具处理。文字转语音与代理通话的单价彼此相当,而音频工具处理的每分钟成本大约只有前两者的十五分之一。免费档的额度在实际使用中相当有限:5,000 积分只能换 5 分钟文字转语音或 3 次音频工具使用。
其他与档位挂钩的限制,对体验的影响不亚于积分数量本身。单次转换字符数从免费档的 500 提升到 Starter 档起的 5,000。音频工具的单次时长上限从免费档的 5 分钟依次升至 10、20、60 直到 180 分钟。文字转语音的并发生成数从 Starter 档的 3 路增加到 Scale 与 Business 档的 15 路。Enterprise 档另增 DPA 与 SLA 的定制条款、面向 HIPAA 客户的 BAA、定制 SSO、更高并发上限与优先支持。
订阅之前有两件关于付款的事需要强调。条款写明,除购买时另有说明或法律另有要求外,所有款项一律不可退款——订阅费、按量计费与一次性购买皆然,例外情况由公司自行酌情处理且并无义务。另外,多位独立评测者反映价格要到安装之后才会显示;而公开的定价页本身让接受这一点变得没有必要:先读它。
ElevenLabs 是克隆还原度与表现力型文字转语音的参照系,TechCrunch 的报道把 Voice.ai 归入同一大类的同时,也提到 ElevenLabs 在声音克隆上以「好得令人不安」而知名。如果你的需求是最高质量的合成旁白且不需要实时变换,那它是更直接的选择。
Respeecher 处在专业语音到语音的另一端,在影视制作领域有实绩。当需求是把某个特定目标说话人还原到广播级标准、而非实时变换音色时,它是更贴切的对照对象。
Voicemod 是实时游戏变声一侧最直接的竞品,Trustpilot 页面的「其他人也看了」栏目正把两者并列,显示 Voicemod 为 1.7 分、456 条评论,而 Voice.ai 为 2.0 分、233 条评论。两者分数都不高,且两个档案都存在下文讨论的抽样问题。
Murf 与 Acapela 被 TechCrunch 列为语音模拟领域的既有厂商,它们更接近传统配音制作,而非实时变换。
专门的语音代理平台 是电话业务这条线的相关对照。如果唯一的需求是呼叫自动化、变声完全无关,那么应当在并发能力、电话功能与合规文档这几个维度上,把 Voice.ai 的代理档位与专注做对话平台的产品做比较,而不是比声音库大小。
实时变换存在硬件下限。 Live Mode 依赖本地显卡处理。公司同时记录了最低 GPU 要求和一条专门的「显卡不受支持」警告,第三方测试则指出在大致低于 GTX 980 或 RX 580 这一档的硬件上会出现卡顿,有用户报告显卡占用达到 87%。没有任何订阅档位能解除这个约束。
移动端与桌面端不对等。 官方 FAQ 自己提出并回答了「为什么手机版还没有实时变声」。任何以手机端实时变换为核心场景的用户,都应在付费前确认当前状态。
官方对克隆所需时长给出了两个互相矛盾的数字。 首页是 10 秒,克隆页是 15 秒,同期发布且未作调和。
社区评分偏低,且抽样并不中性。 Trustpilot 显示 2.0 分、233 条评论,其分布高度两极:82% 为一星,14% 为五星,中间几乎是空的。该档案自 2023 年 8 月起已被企业认领,公司主动邀请客户评价,并回复了 100% 的差评——由邀评驱动的样本与自然形成的样本存在系统性差异,因此这一分数应当与其他渠道并列解读,而不是取而代之。App Store 上 4.0 分、189 条评分的结果在样本量相当的情况下明显更正面;而 Trustpilot 对 59 条近期评论的摘要,集中在自动续订、意外续费扣款与客服无回应上,而非核心音质问题。
关于计费的投诉在多个独立信源之间高度一致。 Comparitech 点名了安装后才显示订阅价格,以及严格而繁琐、需要另行注册的退款流程。Onerep 报告了定价与试用额度说明不清,以及用户在取消后仍被扣费的情况。条款本身确认了不可退款是默认状态。
产品被描述为仍处于 beta 阶段。 Onerep 在 2026 年 1 月的评估中指出,截至 2026 年 Voice.ai 仍处于 beta,并以此解释用户遇到的种种问题。
商用权利的表述前后不一致。 定价页把商用许可列为 Starter 档起的权益,而条款两处写明服务仅供个人非商业用途,且商业、企业、API 或其他商业用途需另行签署协议。官网没有解释两者如何衔接。任何计划商业化部署的人,都应当把这一点以书面形式确认下来。
对产出物与声音资产不提供任何担保。 条款写明公司不保证任何产出物或声音资产不侵权、已获授权或适合特定用途,并声明平台上所有声音均由用户生成、公司对此不承担责任。赔偿条款把第三方权利主张的后果放在用户一侧。
你的输入会被用于训练模型。 上传的输入会授予一项永久、不可撤销、全球、免版税、可再许可的许可,其用途明确包含训练与改进公司模型以及开发新产品。公司确实承诺不会在未获明确许可的情况下单独商业化你的声音,但这个承诺比「不用于训练」要窄得多。
贡献算力是使用条件的一部分。 使用服务即附带同意公司将你的硬件用于 metamodel 训练,可随时关闭,但未说明默认状态。
隐私文档缺乏具体信息。 Onerep 报告称其未说明加密方式、未给出保留期限,且加州以外的用户没有数据删除选项。Comparitech 则指出该服务不响应 Do Not Track。不过 Comparitech 的总体结论仍是:在采取一定预防措施的前提下产品是安全的,其未发现数据泄露或法律诉讼。
合规声明没有配套证据。 官网称完全符合 GDPR、SOC 2、HIPAA 及所有主要企业法规,但未公布审计报告或认证编号。企业采购方应当索取相应的底层文档。
年龄与司法管辖。 使用要求年满 18 岁。管辖法为特拉华州法律,并由特拉华州法院专属管辖——这对美国境外用户是一个实质性的考量。
确实存在一个真正的免费档,但它很窄。它每月提供 5,000 积分,约合 5 分钟文字转语音或 3 次音频工具使用;单次转换上限 500 字符;不含任何即时声音克隆;并且不允许下载生成的文件。付费档从每月 5 美元起。多位独立评测者批评过「免费变声器」的宣传与付费墙之后内容之间的落差,因此应把免费档视为评估手段,而不是一个可用的工作方案。
这一点确实存在歧义,值得在依赖它之前先以书面形式厘清。定价页把商用许可列为 Starter 档起就包含的权益。而服务条款在两个不同位置写明,服务仅供个人非商业用途,且商业、企业、API 或其他商业用途需与公司另行签署协议。官网没有调和这两种表述。此外条款还免除了「产出物不侵权或已获授权」这一层担保。
需要。条款只在三种条件下允许上传或生成音频内容:使用你本人的声音、取得被使用声音者的明确法律授权,或你的用途在适用法下明确许可(例如戏仿或讽刺)。以欺骗、诈骗或误导为目的冒充真实个人——无论在世还是已故——都被禁止,可能导致立即终止访问、法律行动以及配合执法机关。这里要注意与 App Store 描述之间的落差:商店文案以「听起来像任何人,从名人到虚构角色」为卖点,但真正具有约束力的是条款而非商店文案。
不可以,这一点常常让人措手不及。条款设有名为「No License to Voices」的专条,写明不向用户授予平台上任何声音、声音模型、声音克隆或声音身份的任何权利,其中包括其他用户上传的声音;并且某个声音资产处于公开可见状态,并不等于授予了使用、复制、分发或商业化的许可。在 Voice Universe 中可见,不构成一份授权。
需要一块独立显卡,而且性能要说得过去。Live Mode 在显卡上本地处理音频,官方 FAQ 同时记录了最低 GPU 要求和一条针对不受支持显卡的明确警告。第三方测试报告称,大致低于 Nvidia GTX 980 或 AMD RX 580 这一档的硬件会产生卡顿与断续的输出,有用户报告显卡占用达 87%。而服务端能力——文字转语音、音频工具与语音代理——则没有这类要求。
官网称支持超过 15 种语言,并具名列出英语(美式)、法语、印地语、乌克兰语、日语、韩语、瑞典语、西班牙语(拉美)、葡萄牙语(巴西)、中文、荷兰语、土耳其语、德语与意大利语,并称可以把某个既定音色本地化到另一种口音或语言。
公司在其安全页面上直接回应了这两项指控,称应用会定期送交包括 McAfee、Google 与 Avast 在内的杀毒厂商检测,并公布 VirusTotal 结果;同时称其分布式计算功能与加密货币或挖矿毫无关系,被贡献的算力用于构建声音、训练模型,以及为算力较弱的设备处理语音。两份独立评估大体认同:Comparitech 的结论是在采取预防措施的前提下产品是安全的,未发现数据泄露或法律诉讼;Onerep 的结论是它既不是病毒,也不是挖矿程序,使用也不违法。但两者都就计费透明度与隐私文档提出了另一层面的担忧,而 Comparitech 的主要安全建议是避免上传基于本人声音训练的模型。
上传的输入会授予公司一项永久、不可撤销、全球、免版税、可再许可的非独占许可,涵盖服务运营、训练与改进其模型,以及开发新功能与新产品。公司声明不会在未获明确许可的情况下单独商业化你的声音。另外,使用该服务附带同意将你的硬件用于 metamodel 训练,该功能可随时关闭。第三方评测者指出,其隐私政策未说明加密方式或保留期限,且删除权仅面向加州居民提供。
默认情况下不可以。条款写明,除购买时另有说明或适用法另有要求外,所有款项均不可退款,包括订阅费、按量计费与一次性购买;例外由公司自行酌情决定,且没有义务给予。独立评测者形容其退款流程严格且需要另行注册,而订阅与续费相关的投诉,正是 Trustpilot 近期评论摘要中最集中的主题。
主要差别在于各自优化的目标。Ahrens 对此有过明确表述:其核心价值主张不是完美复制某个特定的人,而是在实时替换音色的同时,保留说话者的情绪、节奏与重音。ElevenLabs 与 Respeecher 是围绕「对目标音色的还原度」为成品内容而构建的。Voice.ai 则围绕实时变换、社区共建的声音库,以及如今的电话语音代理而构建。如果你需要把某一位特定说话人还原到广播级水准,那些专门厂商更合适;如果你需要在游戏或通话中实时听起来像另一个人,这里才是它的主场。