Toolso.AI
Toolso.AI
所有工具分类热门榜单最新工具价格博客
Toolso.AI
Toolso.AI

💌订阅 AI 工具周报

每周精选最新、最热门的AI工具和行业动态,直达您的邮箱 订阅

Toolso.AI
Toolso.AI

发现最好的AI工具,提升你的工作效率

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

热门分类

  • AI写作
  • AI图像
  • AI视频
  • AI编程
  • 更多分类

探索发现

  • 最新收录
  • 热门推荐
  • 更多工具
  • 提交工具
  • 价格

关于

  • 关于我们
  • 联系我们
  • 博客
  • 更新日志

法律

  • Cookie政策
  • 隐私政策
  • 服务条款
  • 退款政策
© 2026 Toolso.AI 保留所有权利
限时推广限时推广加速推广24h 优先审核 · 无需反链 · 30 天推荐展示$29.90到期后 $59.9010月31日后涨价至 $59.90距结束--:--:--立即提交
  1. 首页
  2. 所有工具
  3. AI 工具
  4. Fish Audio
Fish Audio界面预览访问网站
Fish Audio标志

Fish Audio

Fish Audio 是一个围绕逐词情绪控制构建的语音合成与声音克隆平台。它用 10 秒样本克隆一个声音,流式延迟低于 300 毫秒,并公开发布 S2 模型权重——但授权仅限研究与非商业用途,商业使用需另行签约。运营方为 Hanabi AI Inc.。

AI 工具音频生成音频工具#文字转语音#开源#多语言
免费试用
收藏
访问次数
浏览次数
定价
免费
发布日期
2026年8月25日
域名
fish.audio
用户评分

用过这个工具吗?给它评分

为这个工具评分

Fish Audio 工具信息

免费试用
工具信息
收藏
访问次数
浏览次数
定价
免费
发布日期
2026年8月25日
域名
fish.audio
用户评分

用过这个工具吗?给它评分

为这个工具评分

推荐工具

相关工具推荐

免费试用

Fish Audio 是什么?

Fish Audio 是一个语音 AI 平台,它建立在一个核心判断之上:把词念对和把话说好是两个不同的问题,而绝大多数语音合成系统从来只解决了前一个。官网首页把能力归为三条线——文本转语音、声音克隆、语音转文字——三条线共用一个名为 S2 的模型家族。

这个产品真正的定义性特征是逐词级别的表达控制。系统不会把你的稿子平铺直叙地念一遍,而是接受内嵌的自然语言标签,由标签来指挥某一句该怎么念。首页演示区把情绪标签集完整暴露了出来,包含愤怒、悲伤、尴尬、强调、耳语、轻柔、气声、兴奋等,另有一组特效标签覆盖大笑、轻笑、清嗓、抽泣、叹息、喘息,以及短停顿与长停顿。项目自己的代码仓库给出的技术描述比营销文案更精确:它支持用自然语言标签在子词级别对韵律与情绪做细粒度控制,同时原生支持多说话人与多轮对话生成。

运营公司并不匿名,不过它的名称需要理清。站点页脚写的是 Hanabi AI Inc. 拥有版权。而开源许可证文件要求的署名却指向另一个主体,原文写作 39 AI, INC.。本文把两个名称都如实记录而不做合并,因为官网并未解释二者之间的关系。

融资与规模则由公司自己的公告给出。Fish Audio 在成立一周年时完成 5,200 万美元种子轮融资,本轮由两家机构联合领投,其中一家领投方名为 Coreline Ventures,另一家是今日资本(Capital Today)。跟投方还包括 359 Capital、Play Time 等多家机构,另有 HF0 与 645 Ventures 等参与其中。同一篇文章还写明团队从 3 人扩到 22 人,年度经常性收入从零做到 2,100 万美元,平台上有 800 万以上创作者与开发者,社区语音库有 200 万以上语音模型。这些业务指标都是公司自报、未经独立审计的,因此只能当作公司的说法而非已核实的数据来读。文章同样具名披露了核心团队:首席执行官 Rissa Cao 自述在亚马逊与 Meta 做过多年语音 AI,首席科学家 Shijia Liao 曾是英伟达的研究工程师,最早是在自己卧室里用一块 4090 显卡训练模型。

用它之前值得先弄清的两件事

关于这个产品,有两件事值得比功能清单更严格的审视,本文都在下文专门展开而不是一笔带过。第一件是当你克隆别人的声音时,平台究竟要求你做到什么。第二件是这里所说的「开源」到底意味着什么,因为它的许可证并不是这个词通常暗示的那种宽松协议。两个答案都不构成不用这个产品的理由,但都会改变你该怎么用它。

核心功能

10 秒样本克隆声音

克隆这条线的宣传很具体,而且在这个品类里少见地给出了数字而不是形容词。产品页写明 10 秒参考音频就够,端到端流式延迟低于 300 毫秒,且克隆是跨语种零样本的,覆盖 13 种语言——意思是克隆一次之后,同一个声音可以说其他受支持的语言,不需要重新训练,也不需要第二次录音。

最后这一条对工作流的改变最大。传统配音要么需要一位双语演员,要么每种语言各配一个人,结果是同一份内容在每个市场听起来都像另一个人。跨语种零样本克隆意味着一个录下来的声音身份可以贯穿整个内容库。

可被导演的文本转语音

文本转语音这一侧正是情绪标签体系发挥作用的地方。你不是从一份固定的「风格」清单里挑一个,而是直接在稿子里做标注,标签在它出现的位置生效。这正是子词级这个说法重要的原因:把强调落在句子中的某一个词上,和给整句设定一种情绪,是两种不同的能力,也正是「听起来像在念稿」和「听起来像在表演」之间的差别。

语音转文字与更宽的产品线

这个平台比一个语音合成接口宽得多。产品菜单列出八项独立工具:文本转语音、语音转文字、声音克隆、变声、Story Studio、人声分离、音频翻译、音效生成。语音转文字这一侧的宣传是转写结果中包含多说话人、情绪标签与自然语言描述,也就是说输出的是结构化转写而非一段纯文本。

社区语音库

平台托管着一个庞大的用户上传语音库,按官网自己的计数超过 200 万个,宣称适用于创意叙事、广告与有声书。这在广度上是真实的差异化优势,同时它也是整个产品中与后文授权同意问题纠缠最深的一块——因为这种量级的语音库是由用户填满的,而不是由公司逐条策划的。

公开的模型权重与自托管

S2 的开源模型权重是公开发布的,官网也把自托管与托管 API 并列作为可选路径来推广。以社区指标衡量这个仓库分量不轻:抓取时有 3.24 万 star、2.8 千 fork、101 位贡献者、14 个发行版本,仓库自述为业界领先的开源语音合成项目。至于这份许可证实际允许你做什么,下文有专门一节,答案比「开源」通常暗示的要窄得多。

使用场景

有声书与长篇旁白。 公司自己的说法是,五秒钟很容易,五分钟才是考验——语音合成在单句层面已经够用了十年,一旦拉长就露馅。长篇旁白恰恰是情绪标签与节奏控制真正兑现价值的地方,因为平铺直叙的念法撑不到第二章就让人听不下去。

按生产节奏做视频配音。 把稿子变成贴合画面的旁白而不必去订录音棚,是这类工具用量最大的场景。不用重录就能换语气、加情绪,正是让反复修改变得廉价的关键。

游戏与动画的角色配音。 平台明确瞄准了这一块,而且确实契合:互动媒体需要大量彼此不同的声音,往往多到项目请不起真人来配,而且台词一改就得重新生成。

对话式智能体与客服。 在这个场景里,低于 300 毫秒的流式延迟不是虚荣指标。一个每次回话前都要明显卡顿的语音助手,无论声音多好听都让人觉得是坏的,所以延迟在这里是功能性要求而不是锦上添花。

用一次录音做多语种本地化。 跨语种零样本克隆意味着录一次就能在受支持的语言里保持同一个声音身份——这对受众跨地区的创作者很有用,不过下文关于语言数量的那一节值得先读。

出于延迟或数据考虑的自托管部署。 由于权重是公开的,有严格数据驻留要求或自有推理设施的团队可以自己跑模型,而不必把音频发给第三方。但你这种具体用途是否被允许,取决于许可证——那正是下文那一节的关键所在。

如何使用 Fish Audio

第一步——注册之前先试首页的演示。 首页上有一个可用的文本转语音输入框,预置了一段演示标签体系的稿子,字符上限 3 万,情绪与特效标签面板直接可见。这是判断这套表达控制对你的场景是否名副其实的最快方式。

第二步——注册免费账号。 免费档不需要信用卡,每月给 8,000 额度、最长 7 分钟生成、单次最多 500 字符、3 个公开语音位。

第三步——先决定用现成语音库还是自己克隆。 对很多任务来说,现成的语音库是更快的路,而且完全绕开了授权同意这个问题。克隆是留给那些你确实需要某个特定声音身份的场合——最好是你自己的声音,或者你握有书面许可的声音。

第四步——录制或挑选一段干净的 10 秒参考音频。 10 秒是官方给的下限。参考音频的质量比长度更重要:源越干净,克隆越好,产品页也承认对特别有表现力的声音,更长的样本会有帮助。

第五步——写稿时要带标签,而不只是写词。 这一步是新用户最容易用不足的。把强调标签落在那个真正扛起整句意思的词上,或者在人会换气的地方放一个长停顿,正是让输出从「听着像机器生成」变成「听着像有人在演」的分界线。

第六步——发布之前先确认你的商业使用权。 这不是可有可无的杂务。如下文所述,免费档的商用状态在官网不同位置的表述并不一致,判断错了就意味着你在没有相应权利的情况下发布了变现内容。

第七步——量起来之后转用 API。 开发者文档与 API 参考托管在文档子域上,付费档提供按量计费的 API 访问。

使用技巧与最佳实践

标签要少而准。 情绪标签是导演工具,不是装饰。每个短句都标会让表演听起来不稳定;只标出真正承载这一段情绪重量的那两三处,才会显得是有意为之。

把功夫花在参考录音上,而不是反复重生成。 克隆会继承源音频的声学特征。用一支像样的麦克风在安静房间里录的 10 秒,效果好过一分钟嘈杂的手机录音,而且再怎么重新生成都救不回一段先天有缺陷的参考音频。

按额度而不是按分钟做预算。 官方公布的换算是每分钟生成大约消耗 600 到 625 额度。对照免费档每月 8,000 额度,算下来差不多正好是它标称的 7 分钟。知道这个换算关系,套餐比较就从猜变成了算。

记住额度不结转。 每月配额在计费周期开始时重置,未用完的分钟不会累积到下个月,所以按你的高峰月来选套餐,在淡月就是浪费。

在投入之前先测你自己的语种。 如下文所述,这个平台的语言支持在它自己的页面上有四种不同说法,而且开源仓库里有针对特定文字的活跃缺陷报告。用几个额度在目标语种上生成一段有代表性的样本,能把这个问题一次性问清楚。

任何敏感内容都用私有语音位。 公开提交内容的许可条款明显比私有的更宽,而且公开内容在删号之后可能仍然可用。选公开还是私有是一个权利决策,不是归档偏好。

适用人群

规模化生产的内容创作者。 经常做旁白的视频博主、播客主与课程制作者回报最明显,因为省下的成本会随产量放大。

需要大量角色声音的游戏与动画团队。 需要庞大配音阵容、或者台词经常变动的项目,比小而固定的剧本项目受益更多。

构建语音智能体的开发者。 有文档的 API、低于 300 毫秒的流式延迟、公开的权重,这三样把托管与自托管两条架构路线都覆盖到了。

本地化团队。 跨语种克隆解决的是多市场内容里一个真实且昂贵的问题。

研究者与业余爱好者。 公开的权重对研究与非商业工作是真正可用的,这恰恰是那份许可证所要允许的情形。

哪些人要谨慎。 任何打算做商业自托管部署的人,必须先读下文的许可证那一节,因为默认答案是不允许。任何合规上需要厂商就生物识别数据处理作出明确承诺的人,都应该注意隐私政策说了什么、更要注意它没说什么。而任何打算克隆一个不属于自己的声音的人,需要下文的授权同意那一节,胜过需要一份功能清单。

支持平台

Fish Audio 主要是一个网页应用,任何现代浏览器都能用,无需安装。开发者通道是一套有文档的 REST 接口与 SDK,文档与 API 参考托管在其文档子域上。

移动应用是存在的:服务条款中设有移动应用一节,承认其可用性取决于第三方商店,点名了苹果的 App Store 与安卓应用市场,并要求用户同时遵守这些商店自己的条款。

自托管是官方推广的第三条路。产品页把选择直接摆了出来——自己部署模型、调用其低于 300 毫秒的流式端点,或者把语音接进你的智能体与应用——至于这三条里哪几条对你开放,由许可证决定。

企业部署选项单列,包含私有化部署、零数据留存与 SOC2 合规,报价方式为定制的按量计费、按年结算。

还有一条访问层面的记录:站点的 robots.txt 对谷歌、苹果与必应的爬虫全量放行,同时禁止通用爬虫访问身份验证与文本转语音两类路径。

价格与套餐

价格是直接在套餐页上核实的。需要注意的是,抓取时页面叠加了两项促销——年付三个月免费,加上周年五折——所以下面的月度等效价格反映的是促销价,月付标价在旁边一并列出。

免费档。 每月 0 元,不需要信用卡。含每月 8,000 额度、最长 7 分钟生成、单次最多 500 字符、3 个公开语音位、标准生成速度与增强版声音克隆。

Plus 档。 折合每月 5.5 美元,按年计费 66 美元,对应的月付标价是 15 美元。含每月 25 万额度、最长 200 分钟生成、单次最多 15,000 字符、无限公开语音位加 10 个私有位、优先生成、Voice Design 访问权与 1 个专业语音位。

Pro 档。 折合每月 37.5 美元,按年计费 450 美元,对应月付标价 100 美元。含每月 200 万额度、最长 1,620 分钟、3 个团队席位、单次最多 30,000 字符、无限语音位、5 个专业语音位与 7 天退款保证。

Max 档。 折合每月 749 美元,按年计费 8,988 美元,对应月付标价 999 美元。含每月 2,500 万额度、最长 6,250 分钟、10 个团队席位与 15 个专业语音位。

企业档。 定制报价、按年结算,面向有合规需求的组织,列出的能力包括带组织级管控的按量计费、零数据留存、私有化部署与 SOC2 合规。

额度是怎么算的

官方公布的换算是每分钟生成大约消耗 600 到 625 额度。每月配额在计费周期开始时重置,未用完的分钟不结转。

商业使用权的矛盾

这一点必须挑明说,因为它直接决定你能不能发布自己生成的东西,而且官网在同一个页面上自相矛盾。

套餐页的免费档功能清单里,直接列着「商业使用」这一条。而同一个套餐页往下的常见问题却给出相反的说法:付费订阅者可以将自己拥有的已验证语音用于商业目的,免费档用户只能把生成内容用于个人非商业项目。首页的常见问题与这个限制性说法一致,而且说得更直白:免费档仅供个人使用,要变现或商用(包括视频平台、播客、企业用途)必须升级到付费档才能获得完整商业权利。

也就是说,两处官方表述称免费档仅限个人使用,而一处官方功能清单说的相反。本文把两种读法都如实报告而不做调和,因为调和就等于替它猜。稳妥的做法是按限制性解释来执行,并在把免费档产出用于变现之前先向厂商确认——判断错误的代价完全落在发布者身上。

替代方案

这个品类里被提及最多的对照对象是 ElevenLabs,而 Fish Audio 直接参与了这场对照:站点设有专门的对比板块,其自己的站点地图里还有一个专门的替代页。明确把自己摆在这家在位者的对面是一个有意的选择,潜在用户也应该注意到,由一家厂商发布的、关于其竞争对手的对比页面属于营销材料,而不是独立评测。

公司在这方面的说法是自报的,也应当照此来读:其融资公告称 S2.1 Pro 在盲听测试中被 66% 的听众偏好于主要竞品。该公告并未同时给出方法学、样本量或听众构成,因此单凭这一来源无法独立验证。

不过真正的替代方案轴线并不是另一家托管厂商,而是公开权重所带来的自建与购买之间的选择。对研究与非商业工作而言,自己跑模型是一个多数竞品并不提供的真实选项。对商业工作而言,这个选项需要另行获得许可,于是比较又塌缩回一次直白的托管服务评估。

限制与注意事项

声音克隆的授权同意:平台究竟要求什么

这是最重要的一个问题,而诚实的答案是:责任几乎完全落在使用者身上,平台不做任何事前核查。

表述最清楚的地方是声音克隆页的常见问题,值得逐字引用:你自行负责确认已就任何你要克隆的声音取得所需的权利、同意与披露,并遵守适用法律,包括你所在地区关于姓名、肖像与 AI 生成内容的法律。同一条回答还给出了执行姿态:平台不对个别用途做事前审核,但可能会移除违反其条款或适用法律的内容或账号。也就是说,机制是事后下架,而不是克隆之前的一道闸门。

值得注意的是,具有约束力的法律文件里反而没有任何授权同意条款。服务条款中关于许可与限制的那一节列出了从 (a) 到 (q) 十七项禁止行为,其中没有一条专门针对声音克隆的授权同意。最接近的是泛化的第 (a) 条,禁止提供任何侵犯他人知识产权或其他权利的内容。用户提交内容的保证条款同样泛化,禁止提交侵犯第三方版权或其他权利(例如商标、隐私权)的内容。两者都没有设定「必须持有所克隆声音的书面同意」这样的具体义务。

同意声明与同一页面上的营销文案之间还存在张力。声音克隆页的主标题文案邀请的恰恰是那份同意声明所警告的用法:让一位在任总统为你的约会软件配旁白、以科技亿万富翁的口吻为你最糟糕的点子办发布会,或者做一档全是假嘉宾的播客。该页常见问题又进一步强化了这种预期,指出大多数公众人物的片段、播客剪辑或电话质量的录音第一次就能用。一边把克隆可识别的公众人物摆在最显眼的位置做卖点,一边在旁边写一句让你去取得对方同意的免责声明,这是一处真实存在的不一致,读者应当把两面都掂量进去。

条款确实附带了一项相关义务:用户不得以误导方式分发内容,包括但不限于声称内容完全由人类生成;平台也鼓励主动披露内容由 AI 技术创作——不过它把披露写成了鼓励而非义务。页脚设有滥用举报入口。

实际结论很清楚。如果你克隆的是自己的声音,上面这些都不构成约束。如果你克隆的是别人的,平台不会拦你也不会核查,但它同时免除了自己的责任,把法律风险完完整整地放在你这一边——而在某些法域,这个风险相当可观。

这里的「开源」是什么意思,又不是什么意思

官网反复主打开放性:把「开源 S2 模型」当作标题级卖点,把自托管作为受支持的路径来呈现,代码仓库自述为业界领先的开源语音合成项目,背后有 3.24 万 star 撑着。权重确实是公开的,这一点是真的。但那份许可证并不宽松,而这个差别在商业层面很关键。

仓库明确写出:本代码库及其配套模型权重依据 FISH AUDIO RESEARCH LICENSE 发布,并警告将对任何违反行为采取行动。这份许可证最后更新于 2026 年 3 月 7 日,在引言中说明了自己的意图:本协议旨在让研究与非商业用途免费使用这些材料,任何商业使用都需要 Fish Audio 另行授予的单独许可。

第三节把含糊空间彻底消除了:任何将这些材料或衍生作品用于商业目的的行为,都需要与 Fish Audio 签订单独的书面许可协议,本协议不授予任何商业权利。商业许可通过许可证中给出的商务邮箱洽谈。

而「商业目的」的定义宽到足以覆盖大多数企业用法:它涵盖创建、修改或分发你的产品或服务(包括通过托管服务或应用程序接口),你的企业或组织的内部运营,以及任何与收费或直接间接产生收入的产品或服务相关的使用。公司内部使用就已经够格了——你并不需要去转售这个模型。

还有两处与宽松许可的区别值得注意。研究授权被描述为非独占、全球范围、不可转让、不可转授权、可撤销且免版税——可撤销是关键词,这在通行的宽松许可条款里没有对应物。而分发则附带署名义务:需要一份署名文件写明版权归属 39 AI, INC.,并在相关网站或产品文档的显著位置展示「Built with Fish Audio」字样。该许可证还禁止使用这些材料或其输出去创建或改进任何基础生成式 AI 模型。

有一处缺口需要记录在案。该许可证以引用方式并入了一份可接受使用政策,把遵守该政策设为许可条件——但这份文件没能找到。多条候选路径均返回 404,站点自己的静态站点地图里也没有这一条目,那份地图只列出首页、发现页、AI 语音生成器页、客户页、企业页、竞品替代页、条款页、隐私页与日本法律信息页。一项具有约束力的条件指向了一份用户找不到的文件,这是一个值得在依赖该许可证之前先向厂商问清楚的文档问题。

简短版本是:权重开放,是的;宽松意义上的开源,不是。研究与业余使用免费且确实被允许。任何商业用途——包括企业内部使用——都需要一份单独的付费协议,无论营销页面暗示了什么。

隐私政策没有涉及的部分

这份隐私政策标注的生效日期是 2024 年 8 月 28 日。对政策正文做的全文检查发现,「voice」「biometric」「train」三个词的出现次数均为零。对一个核心功能就是采集并复现人声的产品来说,缺少任何语音专属或生物识别数据的条款是一个实质性缺口;这也意味着这份政策完全没有就用户内容是否被用于训练或改进模型作出任何表述。根据现有证据,诚实的表述是这份政策对这些问题保持沉默,而不是说存在或不存在某种特定保护。

上传的音频落入泛化的用户内容类别,该政策把这一类定义为包含在你提供给服务的输入、文件上传或反馈中的个人信息。与该类别一并列出的第三方包括服务提供商、广告合作方、分析合作方与业务合作方。

你为自己的上传内容授予了什么

条款对于你给出去的权利,写得比对你保留的权利具体得多。用户提交内容授予平台的许可是免版税、永久、可转授权、不可撤销且全球范围的。

删除也因此是有边界的。删除账号后,平台会停止向其他用户展示你的提交内容,但明确把公开提交内容排除在外,因为后者可能仍然完全可用;条款还承认,可能无法从其记录中彻底删除这些内容。

公开提交内容承载的条款是所有类别里最宽的,包括为其市场与推广目的展示、表演与分发的权利,以及授予其他所有用户访问并行使其中权利的许可。这正是私有语音位与公开语音位之间的选择成为权利决策的具体原因。把它当作理解那个 200 万语音社区库的背景也很有用——那个库之所以存在,正是因为公开上传承载着这些条款。

语言支持有四种说法

官方页面给出了四个互不一致的数字,本文把四个都列出来而不做平均。声音克隆页说跨语种零样本覆盖 13 种语言。首页的接口板块说语音支持 30 多种语言。文本转语音页的常见问题只列举了八种——英语、日语、韩语、汉语、法语、德语、阿拉伯语、西班牙语——并另行标注自动支持八种语言的原生口音。融资公告则称支持 83 种以上语言并具备原生节奏。

这些说法可能描述的是不同的东西:克隆与合成之别,或者完整支持与尽力支持之别。但官网并未解释这个区分,所以请用实测来验证你自己的语种,而不要相信其中任何单一数字。

社区的反馈也支持这份谨慎。开源仓库里有活跃议题报告旁遮普语古木基文输入在处理叠音符与鼻化标记时出错,另有一条配套的改进请求,希望通过带附加符号的拉丁转写或字素到音素转换来改善旁遮普语发音。抓取时该仓库有 7 个开放议题与 684 个已关闭议题——这个维护比例是健康的,但同时也说明分语种的质量并不均匀。

其他注意事项

没有发布前的内容审核。 仓库自己的法律免责声明写道:我们不对该代码库的任何非法使用承担责任,请自行参照你所在地关于数字千年版权法及其他相关法律的规定。结合不做事前审核的立场,责任被一致地推向了下游。

禁止反向工程与竞品模型。 条款禁止试图获取源代码、模型底层组件或算法,并另行禁止使用服务输出去开发与之竞争的模型。

年龄要求。 使用者须年满 13 岁,未满 18 岁需要父母许可,平台声明不会在知情情况下收集 16 岁以下儿童的可识别个人信息。

目录元数据老化很快。 本条收录记录的分类是「时尚」,标签里还有「时尚」与「模板」——对一个语音合成产品来说明显错误;其收录描述提到 1000 多个语音,而官网现在称超过 200 万。迭代快的产品会把自己的目录条目甩在身后,具体数字请以官网为准。

常见问题(FAQ)

Q1. Fish Audio 可以免费使用吗?

存在一个真实的免费档,不需要信用卡,提供每月 8,000 额度、最长 7 分钟生成、单次 500 字符上限与 3 个公开语音位。至于这些产出能否商用,从官网上看确实不清楚:套餐页的免费档功能清单里列着「商业使用」,而同一页的常见问题与首页的常见问题都写明免费档产出仅供个人非商业使用。请按限制性解释执行,并在把免费档产出用于变现之前向厂商确认。

Q2. 克隆别人的声音需要经过对方同意吗?

平台把这项责任完全放在你身上,并且不做任何事前核查。其克隆页的常见问题写明:你自行负责确认已就任何你要克隆的声音取得所需的权利、同意与披露,并遵守你所在地区关于姓名、肖像与 AI 生成内容的法律。它同时说明不对个别用途做事前审核,可能在事后移除内容或账号。需要注意的是,具有约束力的服务条款中并不存在专门要求声音克隆同意的条款——只有关于不得侵犯他人权利的泛化禁令——而同一个产品页的营销文案却在积极建议克隆公众人物。从法律上说,风险敞口是你的。

Q3. 这个模型真的是开源的吗?

权重确实公开发布,但许可证并不宽松。代码库与模型权重均依据 Fish Audio 研究许可证发布,该许可证在引言中说明其意图是让研究与非商业用途免费,任何商业使用都需要单独许可,第三节则完全不授予任何商业权利。研究、学习与业余使用免费;其他任何用途都需要一份单独的付费协议。

Q4. 我可以为我的企业自托管吗?

在公开许可证下不可以。该许可证对商业目的的定义明确包含:通过托管服务或接口创建、修改或分发你的产品或服务,你所在组织的内部运营,以及任何与直接或间接产生收入的产品或服务相关的使用。仅仅是企业内部使用就已经触发。你需要一份单独的书面协议,可通过许可证中给出的商务联系邮箱获取。另需注意研究授权是可撤销的,这与通行的宽松许可不同。

Q5. 克隆一个声音需要多少音频,效果如何?

官方给出的最低要求是 10 秒干净人声,产品页指出对特别有表现力的声音更长的样本会有帮助。参考音频的质量比时长更重要——一段干净的短样本胜过一段冗长嘈杂的录音。平台另外说明克隆是跨语种零样本的,覆盖 13 种语言,因此一次录音就能延伸到其他受支持的语言而无需重新训练。

Q6. 它到底支持多少种语言?

官网给出了四个不同答案,本文不替你挑一个。克隆页说跨语种克隆 13 种;首页说 30 多种;文本转语音页的常见问题列举了八种具体语言并标注自动支持八种语言的原生口音;融资公告称 83 种以上。这些说法很可能描述的是不同能力,但官网并未说明哪个是哪个。请在投入之前用目标语种生成一段测试样本——开源仓库里有针对特定文字的活跃缺陷报告,包括旁遮普语古木基文对叠音符与鼻化标记的处理问题。

Q7. 免费档之外要花多少钱?

抓取时列出四个付费档,且叠加了促销。Plus 折合每月 5.5 美元、按年计费 66 美元,对应月付标价 15 美元,含每月 25 万额度。Pro 折合每月 37.5 美元、按年计费 450 美元,对应标价 100 美元,含 200 万额度与 3 个团队席位。Max 折合每月 749 美元、按年计费 8,988 美元,对应标价 999 美元,含 2,500 万额度与 10 个团队席位。企业档为定制、按年结算。大约 600 到 625 额度换一分钟生成,且未用完的额度不结转。

Q8. 我上传的声音会被用来训练他们的模型吗?

隐私政策没有说。对政策正文的全文检查未发现「train」「voice」「biometric」任何一个词的出现,该政策标注的生效日期是 2024 年 8 月 28 日。这意味着在这个问题上不存在任何公开承诺,而断言一份文件里并不存在的保护是不对的。上传音频落入泛化的用户内容类别,该类别列出的共享对象包括服务提供商、广告、分析与业务合作方。如果这一点对你的合规立场很重要,请直接向厂商询问——另需注意企业档把零数据留存单列为一项特性。

Q9. 如果我删除账号,我的声音会怎样?

删除是部分的而非彻底的。条款写明,删除账号后平台会停止向其他用户展示你的提交内容,但明确把公开提交内容排除在外,因为后者可能仍然完全可用;条款还承认可能无法从其记录中彻底删除这些内容。由于所授予的许可是永久、可转授权且不可撤销的,而公开提交内容还额外授予了市场推广权利以及面向其他所有用户的访问权,因此选择私有而非公开语音位是一个有实质意义的决定,不是归档偏好。

Q10. Fish Audio 背后是谁,公司到什么阶段了?

站点页脚写的是 Hanabi AI Inc.,而开源许可证要求的署名却指向 39 AI, INC.——两个名称本文都如实记录,官网并未解释二者关系。公司宣布在成立一周年时完成 5,200 万美元种子轮融资,本轮的领投方之一名为 Coreline Ventures,另一家领投机构则是今日资本(Capital Today)。其自己的公告称团队 22 人、年度经常性收入 2,100 万美元、平台用户 800 万以上、社区语音模型 200 万以上,并具名列出首席执行官 Rissa Cao 与首席科学家 Shijia Liao。这些业务数字均为自报,未经独立审计。

发现类似工具?
如果你知道其他优秀的AI工具,欢迎提交给我们