用過這個工具嗎?為它評分
Fish Audio 是一個語音 AI 平台,它建立在一項核心判斷之上:把字唸對和把話說好是兩個不同的問題,而絕大多數語音合成系統從來只解決了前一個。官網首頁把能力歸為三條線——文字轉語音、聲音克隆、語音轉文字——三條線共用一個名為 S2 的模型家族。
這項產品真正具有定義性的特徵,是逐字層級的表達控制。系統不會把你的稿子平鋪直敘地唸過一遍,而是接受內嵌的自然語言標籤,由標籤指揮某一句該怎麼唸。首頁的示範區把情緒標籤集完整攤了出來,涵蓋憤怒、悲傷、尷尬、強調、耳語、輕柔、氣音、興奮等,另有一組特效標籤覆蓋大笑、輕笑、清喉嚨、啜泣、嘆息、喘息,以及短停頓與長停頓。專案自己的程式碼儲存庫給出的技術描述,比行銷文案更精確:它支援以自然語言標籤在子詞層級對韻律與情緒做細緻控制,同時原生支援多說話人與多輪對話生成。
營運公司並不匿名,不過它的名稱需要理一理。網站頁尾寫的是 Hanabi AI Inc. 擁有版權。而開源授權條款檔案要求的署名卻指向另一個主體,原文寫作 39 AI, INC.。本文把兩個名稱都如實記錄而不做合併,因為官網並未說明兩者之間的關係。
募資與規模則由公司自己的公告給出。Fish Audio 在成立滿一年時完成 5,200 萬美元種子輪募資。本輪由兩家機構聯合領投,其中一家領投方名為 Coreline Ventures,另一家是今日資本(Capital Today)。跟投方還包括 359 Capital、Play Time 等多家機構,另有 HF0 與 645 Ventures 等參與其中。同一篇文章還寫明團隊從 3 人擴到 22 人,年度經常性收入從零做到 2,100 萬美元,平台上有 800 萬以上創作者與開發者,社群語音庫有 200 萬以上語音模型。這些業務指標都是公司自報、未經獨立稽核的,因此只能當作公司的說法,而不是已核實的數據來讀。文章同樣具名揭露了核心團隊:執行長 Rissa Cao 自述在亞馬遜與 Meta 做過多年語音 AI,首席科學家 Shijia Liao 曾是輝達的研究工程師,最早是在自己臥室裡用一張 4090 顯示卡訓練模型。
關於這項產品,有兩件事值得比功能清單更嚴格的檢視,本文都在下文專門展開而不是一筆帶過。第一件是當你克隆別人的聲音時,平台究竟要求你做到什麼。第二件是這裡所說的「開源」到底是什麼意思,因為它的授權條款並不是這個詞通常暗示的那種寬鬆協議。兩個答案都不構成不用這項產品的理由,但都會改變你該怎麼用它。
克隆這條線的宣傳很具體,而且在這個品類裡少見地給出了數字而不是形容詞。產品頁寫明 10 秒參考音訊就夠,端到端串流延遲低於 300 毫秒,且克隆是跨語種零樣本的,涵蓋 13 種語言——意思是克隆一次之後,同一個聲音可以說其他受支援的語言,不需要重新訓練,也不需要第二次錄音。
最後這一條對工作流程的改變最大。傳統配音要嘛需要一位雙語演員,要嘛每種語言各配一個人,結果是同一份內容在每個市場聽起來都像另一個人。跨語種零樣本克隆意味著一個錄下來的聲音身分可以貫穿整個內容庫。
文字轉語音這一側,正是情緒標籤體系發揮作用的地方。你不是從一份固定的「風格」清單裡挑一個,而是直接在稿子裡標註,標籤在它出現的位置生效。這正是子詞層級這個說法重要的原因:把強調落在句子中的某一個字上,和替整句設定一種情緒,是兩種不同的能力,也正是「聽起來像在唸稿」與「聽起來像在演」之間的差別。
這個平台比一個語音合成介面寬得多。產品選單列出八項獨立工具:文字轉語音、語音轉文字、聲音克隆、變聲、Story Studio、人聲分離、音訊翻譯、音效生成。語音轉文字這一側的宣傳是轉寫結果中包含多說話人、情緒標籤與自然語言描述,也就是說輸出的是結構化轉寫,而不是一段純文字。
平台託管著一個龐大的使用者上傳語音庫,按官網自己的計數超過 200 萬個,宣稱適用於創意敘事、廣告與有聲書。這在廣度上是真實的差異化優勢,同時它也是整個產品中與後文授權同意問題糾纏最深的一塊——因為這種量級的語音庫是由使用者填滿的,而不是由公司逐條策劃的。
S2 的開源模型權重是公開釋出的,官網也把自架部署與託管 API 並列,當作可選路徑來推廣。以社群指標衡量,這個儲存庫分量不輕:抓取時有 3.24 萬顆星、2.8 千次分支、101 位貢獻者、14 個發行版本,儲存庫自述為業界領先的開源語音合成專案。至於這份授權條款實際允許你做什麼,下文有專門一節,答案比「開源」通常暗示的要窄得多。
有聲書與長篇旁白。 公司自己的說法是,五秒鐘很容易,五分鐘才是考驗——語音合成在單句層面已經夠用了十年,一旦拉長就露餡。長篇旁白恰恰是情緒標籤與節奏控制真正兌現價值的地方,因為平鋪直敘的唸法撐不到第二章就讓人聽不下去。
按生產節奏做影片配音。 把稿子變成貼合畫面的旁白而不必去訂錄音室,是這類工具用量最大的情境。不用重錄就能換語氣、加情緒,正是讓反覆修改變得便宜的關鍵。
遊戲與動畫的角色配音。 平台明確瞄準了這一塊,而且確實契合:互動媒體需要大量彼此不同的聲音,往往多到專案請不起真人來配,而且台詞一改就得重新生成。
對話式智慧代理與客服。 在這個情境裡,低於 300 毫秒的串流延遲不是虛榮指標。一個每次回話前都要明顯卡頓的語音助理,無論聲音多好聽都讓人覺得是壞的,所以延遲在這裡是功能性要求,而不是錦上添花。
用一次錄音做多語系在地化。 跨語種零樣本克隆意味著錄一次就能在受支援的語言裡保持同一個聲音身分——這對受眾跨地區的創作者很有用,不過下文關於語言數量的那一節值得先讀。
出於延遲或資料考量的自架部署。 由於權重是公開的,有嚴格資料落地要求或自有推論基礎設施的團隊可以自己跑模型,而不必把音訊送給第三方。但你這種具體用途是否被允許,取決於授權條款——那正是下文那一節的關鍵所在。
第一步——註冊之前先試首頁的示範。 首頁上有一個可用的文字轉語音輸入框,預先放了一段示範標籤體系的稿子,字元上限 3 萬,情緒與特效標籤面板直接可見。這是判斷這套表達控制對你的情境是否名副其實的最快方式。
第二步——註冊免費帳號。 免費方案不需要信用卡,每月給 8,000 點數、最長 7 分鐘生成、單次最多 500 字元、3 個公開語音欄位。
第三步——先決定用現成語音庫還是自己克隆。 對很多工作來說,現成的語音庫是更快的路,而且完全繞開了授權同意這個問題。克隆是留給那些你確實需要某個特定聲音身分的場合——最好是你自己的聲音,或者你握有書面許可的聲音。
第四步——錄製或挑選一段乾淨的 10 秒參考音訊。 10 秒是官方給的下限。參考音訊的品質比長度更重要:來源越乾淨,克隆越好,產品頁也承認對特別有表現力的聲音,更長的樣本會有幫助。
第五步——寫稿時要帶標籤,而不只是寫字。 這一步是新使用者最容易用不足的。把強調標籤落在那個真正扛起整句意思的字上,或者在人會換氣的地方放一個長停頓,正是讓輸出從「聽著像機器生成」變成「聽著像有人在演」的分界線。
第六步——發布之前先確認你的商業使用權。 這不是可有可無的雜務。如下文所述,免費方案的商用狀態在官網不同位置的表述並不一致,判斷錯了就意味著你在沒有相應權利的情況下發布了變現內容。
第七步——量起來之後轉用 API。 開發者文件與 API 參考託管在文件子網域上,付費方案提供按量計費的 API 存取。
標籤要少而準。 情緒標籤是導戲工具,不是裝飾。每個短句都標,會讓表演聽起來不穩定;只標出真正承載這一段情緒重量的那兩三處,才會顯得是刻意為之。
把功夫花在參考錄音上,而不是反覆重新生成。 克隆會繼承來源音訊的聲學特徵。用一支像樣的麥克風在安靜房間裡錄的 10 秒,效果好過一分鐘吵雜的手機錄音,而且再怎麼重新生成,都救不回一段先天有缺陷的參考音訊。
按點數而不是按分鐘做預算。 官方公布的換算是每分鐘生成大約消耗 600 到 625 點數。對照免費方案每月 8,000 點數,算下來差不多正好是它標稱的 7 分鐘。知道這個換算關係,方案比較就從猜變成了算。
記住點數不會累積。 每月額度在計費週期開始時重設,未用完的分鐘不會結轉到下個月,所以按你的高峰月來選方案,在淡月就是浪費。
在投入之前先測你自己的語種。 如下文所述,這個平台的語言支援在它自己的頁面上有四種不同說法,而且開源儲存庫裡有針對特定文字的活躍缺陷回報。用幾個點數在目標語種上生成一段有代表性的樣本,能把這個問題一次問清楚。
任何敏感內容都用私人語音欄位。 公開提交內容的授權條款明顯比私人的更寬,而且公開內容在刪除帳號之後可能仍然可用。選公開還是私人是一個權利決策,不是歸檔偏好。
規模化生產的內容創作者。 經常做旁白的影音創作者、Podcast 主持人與課程製作者回報最明顯,因為省下的成本會隨產量放大。
需要大量角色聲音的遊戲與動畫團隊。 需要龐大配音陣容、或者台詞經常變動的專案,比小而固定的劇本專案受益更多。
建構語音智慧代理的開發者。 有文件的 API、低於 300 毫秒的串流延遲、公開的權重,這三樣把託管與自架兩條架構路線都涵蓋到了。
在地化團隊。 跨語種克隆解決的是多市場內容裡一個真實且昂貴的問題。
研究者與業餘愛好者。 公開的權重對研究與非商業工作是真正可用的,這恰恰是那份授權條款所要允許的情形。
哪些人要謹慎。 任何打算做商業自架部署的人,必須先讀下文的授權條款那一節,因為預設答案是不允許。任何在法遵上需要廠商就生物辨識資料處理作出明確承諾的人,都應該注意隱私權政策說了什麼、更要注意它沒說什麼。而任何打算克隆一個不屬於自己的聲音的人,需要下文的授權同意那一節,勝過需要一份功能清單。
Fish Audio 主要是一個網頁應用程式,任何現代瀏覽器都能用,不需要安裝。開發者通道是一套有文件的 REST 介面與 SDK,文件與 API 參考託管在其文件子網域上。
行動應用程式是存在的:服務條款中設有行動應用程式一節,承認其可用性取決於第三方商店,點名了蘋果的 App Store 與 Android 應用市集,並要求使用者同時遵守這些商店自己的條款。
自架部署是官方推廣的第三條路。產品頁把選擇直接攤了出來——自己部署模型、呼叫其低於 300 毫秒的串流端點,或者把語音接進你的智慧代理與應用程式——至於這三條裡哪幾條對你開放,由授權條款決定。
企業部署選項單獨列出,包含私有部署、零資料留存與 SOC2 法遵,報價方式為客製的按量計費、按年結算。
還有一條存取層面的紀錄:網站的 robots.txt 對 Google、Apple 與 Bing 的爬蟲全量放行,同時禁止一般爬蟲存取身分驗證與文字轉語音兩類路徑。
價格是直接在方案頁上核實的。需要注意的是,抓取時頁面疊加了兩項促銷——年繳三個月免費,加上週年五折——所以下面的每月等效價格反映的是促銷價,月繳標價在旁邊一併列出。
免費方案。 每月 0 元,不需要信用卡。含每月 8,000 點數、最長 7 分鐘生成、單次最多 500 字元、3 個公開語音欄位、標準生成速度與增強版聲音克隆。
Plus 方案。 折合每月 5.5 美元,按年計費 66 美元,對應的月繳標價是 15 美元。含每月 25 萬點數、最長 200 分鐘生成、單次最多 15,000 字元、無限公開語音欄位加 10 個私人欄位、優先生成、Voice Design 存取權與 1 個專業語音欄位。
Pro 方案。 折合每月 37.5 美元,按年計費 450 美元,對應月繳標價 100 美元。含每月 200 萬點數、最長 1,620 分鐘、3 個團隊席次、單次最多 30,000 字元、無限語音欄位、5 個專業語音欄位與 7 天退款保證。
Max 方案。 折合每月 749 美元,按年計費 8,988 美元,對應月繳標價 999 美元。含每月 2,500 萬點數、最長 6,250 分鐘、10 個團隊席次與 15 個專業語音欄位。
企業方案。 客製報價、按年結算,面向有法遵需求的組織,列出的能力包括帶組織層級管控的按量計費、零資料留存、私有部署與 SOC2 法遵。
官方公布的換算是每分鐘生成大約消耗 600 到 625 點數。每月額度在計費週期開始時重設,未用完的分鐘不會結轉。
這一點必須挑明說,因為它直接決定你能不能發布自己生成的東西,而且官網在同一個頁面上自相矛盾。
方案頁的免費方案功能清單裡,直接列著「商業使用」這一條。而同一個方案頁往下的常見問題卻給出相反的說法:付費訂閱者可以將自己擁有的已驗證語音用於商業目的,免費方案使用者只能把生成內容用於個人非商業專案。首頁的常見問題與這個限制性說法一致,而且說得更直白:免費方案僅供個人使用,要變現或商用(包括影音平台、Podcast、企業用途)必須升級到付費方案才能取得完整商業權利。
也就是說,兩處官方表述稱免費方案僅限個人使用,而一處官方功能清單說的相反。本文把兩種讀法都如實報告而不做調和,因為調和就等於替它猜。穩妥的做法是按限制性解釋來執行,並在把免費方案產出用於變現之前先向廠商確認——判斷錯誤的代價完全落在發布者身上。
這個品類裡被提及最多的對照對象是 ElevenLabs,而 Fish Audio 直接參與了這場對照:網站設有專門的比較區塊,其自己的網站地圖裡還有一個專門的替代頁。明確把自己擺在這家既有業者的對面,是一個刻意的選擇;潛在使用者也應該注意到,由一家廠商發布的、關於其競爭對手的比較頁面屬於行銷素材,而不是獨立評測。
公司在這方面的說法是自報的,也應當照此來讀:其募資公告稱 S2.1 Pro 在盲聽測試中被 66% 的聽眾偏好於主要競品。該公告並未同時給出方法學、樣本數或聽眾組成,因此單憑這一來源無法獨立驗證。
不過真正的替代方案軸線並不是另一家託管廠商,而是公開權重所帶來的自建與外購之間的選擇。對研究與非商業工作而言,自己跑模型是一個多數競品並不提供的真實選項。對商業工作而言,這個選項需要另行取得授權,於是比較又塌縮回一次直白的託管服務評估。
這是最重要的一個問題,而誠實的答案是:責任幾乎完全落在使用者身上,平台不做任何事前查核。
表述最清楚的地方是聲音克隆頁的常見問題,值得逐字引用:你自行負責確認已就任何你要克隆的聲音取得所需的權利、同意與揭露,並遵守適用法律,包括你所在地區關於姓名、肖像與 AI 生成內容的法律。同一條回答還給出了執行姿態:平台不對個別用途做事前審核,但可能會移除違反其條款或適用法律的內容或帳號。也就是說,機制是事後下架,而不是克隆之前的一道閘門。
值得注意的是,具有拘束力的法律文件裡反而沒有任何授權同意條款。服務條款中關於許可與限制的那一節列出了從 (a) 到 (q) 十七項禁止行為,其中沒有一條專門針對聲音克隆的授權同意。最接近的是概括性的第 (a) 條,禁止提供任何侵犯他人智慧財產權或其他權利的內容。使用者提交內容的保證條款同樣概括,禁止提交侵犯第三方著作權或其他權利(例如商標、隱私權)的內容。兩者都沒有設定「必須持有所克隆聲音的書面同意」這樣的具體義務。
同意聲明與同一頁面上的行銷文案之間還存在張力。聲音克隆頁的主標題文案邀請的恰恰是那份同意聲明所警告的用法:讓一位在任總統為你的交友軟體配旁白、以科技億萬富翁的口吻替你最糟糕的點子辦發表會,或者做一檔全是假來賓的 Podcast。該頁常見問題又進一步強化了這種預期,指出大多數公眾人物的片段、Podcast 剪輯或電話品質的錄音第一次就能用。一邊把克隆可辨識的公眾人物擺在最顯眼的位置當賣點,一邊在旁邊寫一句要你去取得對方同意的免責聲明,這是一處真實存在的不一致,讀者應當把兩面都掂量進去。
條款確實附帶了一項相關義務:使用者不得以誤導方式散布內容,包括但不限於聲稱內容完全由人類生成;平台也鼓勵主動揭露內容由 AI 技術創作——不過它把揭露寫成了鼓勵而非義務。頁尾設有濫用檢舉入口。
實際結論很清楚。如果你克隆的是自己的聲音,上面這些都不構成拘束。如果你克隆的是別人的,平台不會攔你也不會查核,但它同時免除了自己的責任,把法律風險完完整整地放在你這一邊——而在某些法域,這個風險相當可觀。
官網反覆主打開放性:把「開源 S2 模型」當作標題級賣點,把自架部署當作受支援的路徑來呈現,程式碼儲存庫自述為業界領先的開源語音合成專案,背後有 3.24 萬顆星撐著。權重確實是公開的,這一點是真的。但那份授權條款並不寬鬆,而這個差別在商業層面很關鍵。
儲存庫明確寫出:本程式碼庫及其配套模型權重依據 FISH AUDIO RESEARCH LICENSE 釋出,並警告將對任何違反行為採取行動。這份授權條款最後更新於 2026 年 3 月 7 日,在引言中說明了自己的意圖:本協議旨在讓研究與非商業用途免費使用這些素材,任何商業使用都需要 Fish Audio 另行授予的單獨授權。
第三節把模糊空間徹底消除了:任何將這些素材或衍生著作用於商業目的的行為,都需要與 Fish Audio 簽訂單獨的書面授權協議,本協議不授予任何商業權利。商業授權透過授權條款中給出的商務信箱洽談。
而「商業目的」的定義寬到足以涵蓋大多數企業用法:它涵蓋建立、修改或散布你的產品或服務(包括透過託管服務或應用程式介面),你的企業或組織的內部營運,以及任何與收費或直接間接產生收入的產品或服務相關的使用。公司內部使用就已經夠格了——你並不需要去轉售這個模型。
還有兩處與寬鬆授權的區別值得注意。研究授權被描述為非專屬、全球範圍、不可轉讓、不可再授權、可撤銷且免權利金——可撤銷是關鍵詞,這在通行的寬鬆授權條款裡沒有對應物。而散布則附帶署名義務:需要一份署名檔案寫明版權歸屬 39 AI, INC.,並在相關網站或產品文件的顯著位置展示「Built with Fish Audio」字樣。該授權條款還禁止使用這些素材或其輸出去建立或改進任何基礎生成式 AI 模型。
有一處缺口需要記錄在案。該授權條款以引用方式併入了一份可接受使用政策,把遵守該政策設為授權條件——但這份文件沒能找到。多條候選路徑均回傳 404,網站自己的靜態網站地圖裡也沒有這一條目,那份地圖只列出首頁、探索頁、AI 語音生成器頁、客戶頁、企業頁、競品替代頁、條款頁、隱私頁與日本法律資訊頁。一項具有拘束力的條件指向了一份使用者找不到的文件,這是一個值得在依賴該授權條款之前先向廠商問清楚的文件問題。
簡短版本是:權重開放,是的;寬鬆意義上的開源,不是。研究與業餘使用免費且確實被允許。任何商業用途——包括企業內部使用——都需要一份單獨的付費協議,無論行銷頁面暗示了什麼。
這份隱私權政策標註的生效日期是 2024 年 8 月 28 日。對政策正文做的全文檢查發現,「voice」「biometric」「train」三個詞的出現次數均為零。對一個核心功能就是採集並複現人聲的產品來說,缺少任何語音專屬或生物辨識資料的條款是一個實質性缺口;這也意味著這份政策完全沒有就使用者內容是否被用於訓練或改進模型作出任何表述。根據現有證據,誠實的表述是這份政策對這些問題保持沉默,而不是說存在或不存在某種特定保護。
上傳的音訊落入概括性的使用者內容類別,該政策把這一類定義為包含在你提供給服務的輸入、檔案上傳或回饋中的個人資訊。與該類別一併列出的第三方包括服務供應商、廣告合作方、分析合作方與業務合作方。
條款對於你給出去的權利,寫得比對你保留的權利具體得多。使用者提交內容授予平台的授權是免權利金、永久、可再授權、不可撤銷且全球範圍的。
刪除也因此是有邊界的。刪除帳號後,平台會停止向其他使用者展示你的提交內容,但明確把公開提交內容排除在外,因為後者可能仍然完全可用;條款還承認,可能無法從其紀錄中徹底刪除這些內容。
公開提交內容承載的條款是所有類別裡最寬的,包括為其市場與推廣目的展示、表演與散布的權利,以及授予其他所有使用者存取並行使其中權利的授權。這正是私人語音欄位與公開語音欄位之間的選擇成為權利決策的具體原因。把它當作理解那個 200 萬語音社群庫的背景也很有用——那個庫之所以存在,正是因為公開上傳承載著這些條款。
官方頁面給出了四個互不一致的數字,本文把四個都列出來而不做平均。聲音克隆頁說跨語種零樣本涵蓋 13 種語言。首頁的介面區塊說語音支援 30 多種語言。文字轉語音頁的常見問題只列舉了八種——英語、日語、韓語、漢語、法語、德語、阿拉伯語、西班牙語——並另行標註自動支援八種語言的原生口音。募資公告則稱支援 83 種以上語言並具備原生節奏。
這些說法可能描述的是不同的東西:克隆與合成之別,或者完整支援與盡力支援之別。但官網並未解釋這個區分,所以請用實測來驗證你自己的語種,而不要相信其中任何單一數字。
社群的回饋也支持這份謹慎。開源儲存庫裡有活躍議題回報旁遮普語古木基文輸入在處理疊音符與鼻化標記時出錯,另有一條配套的改進請求,希望透過帶附加符號的拉丁轉寫或字素到音素轉換來改善旁遮普語發音。抓取時該儲存庫有 7 個開放議題與 684 個已關閉議題——這個維護比例是健康的,但同時也說明分語種的品質並不均勻。
沒有發布前的內容審核。 儲存庫自己的法律免責聲明寫道:我們不對該程式碼庫的任何非法使用承擔責任,請自行參照你所在地關於數位千禧年著作權法及其他相關法律的規定。結合不做事前審核的立場,責任被一致地推向了下游。
禁止還原工程與競品模型。 條款禁止試圖取得原始碼、模型底層元件或演算法,並另行禁止使用服務輸出去開發與之競爭的模型。
年齡要求。 使用者須年滿 13 歲,未滿 18 歲需要父母許可,平台聲明不會在知情情況下蒐集 16 歲以下兒童的可辨識個人資訊。
目錄中繼資料老化很快。 本條收錄紀錄的分類是「時尚」,標籤裡還有「時尚」與「範本」——對一個語音合成產品來說明顯錯誤;其收錄描述提到 1000 多個語音,而官網現在稱超過 200 萬。迭代快的產品會把自己的目錄條目甩在身後,具體數字請以官網為準。
存在一個真實的免費方案,不需要信用卡,提供每月 8,000 點數、最長 7 分鐘生成、單次 500 字元上限與 3 個公開語音欄位。至於這些產出能否商用,從官網上看確實不清楚:方案頁的免費方案功能清單裡列著「商業使用」,而同一頁的常見問題與首頁的常見問題都寫明免費方案產出僅供個人非商業使用。請按限制性解釋執行,並在把免費方案產出用於變現之前向廠商確認。
平台把這項責任完全放在你身上,並且不做任何事前查核。其克隆頁的常見問題寫明:你自行負責確認已就任何你要克隆的聲音取得所需的權利、同意與揭露,並遵守你所在地區關於姓名、肖像與 AI 生成內容的法律。它同時說明不對個別用途做事前審核,可能在事後移除內容或帳號。需要注意的是,具有拘束力的服務條款中並不存在專門要求聲音克隆同意的條款——只有關於不得侵犯他人權利的概括性禁令——而同一個產品頁的行銷文案卻在積極建議克隆公眾人物。從法律上說,風險敞口是你的。
權重確實公開釋出,但授權條款並不寬鬆。程式碼庫與模型權重均依據 Fish Audio 研究授權條款釋出,該條款在引言中說明其意圖是讓研究與非商業用途免費,任何商業使用都需要單獨授權,第三節則完全不授予任何商業權利。研究、學習與業餘使用免費;其他任何用途都需要一份單獨的付費協議。
在公開授權條款下不可以。該條款對商業目的的定義明確包含:透過託管服務或介面建立、修改或散布你的產品或服務,你所在組織的內部營運,以及任何與直接或間接產生收入的產品或服務相關的使用。僅僅是企業內部使用就已經觸發。你需要一份單獨的書面協議,可透過授權條款中給出的商務聯絡信箱取得。另需注意研究授權是可撤銷的,這與通行的寬鬆授權不同。
官方給出的最低要求是 10 秒乾淨人聲,產品頁指出對特別有表現力的聲音,更長的樣本會有幫助。參考音訊的品質比時長更重要——一段乾淨的短樣本勝過一段冗長吵雜的錄音。平台另外說明克隆是跨語種零樣本的,涵蓋 13 種語言,因此一次錄音就能延伸到其他受支援的語言而無需重新訓練。
官網給出了四個不同答案,本文不替你挑一個。克隆頁說跨語種克隆 13 種;首頁說 30 多種;文字轉語音頁的常見問題列舉了八種具體語言並標註自動支援八種語言的原生口音;募資公告稱 83 種以上。這些說法很可能描述的是不同能力,但官網並未說明哪個是哪個。請在投入之前用目標語種生成一段測試樣本——開源儲存庫裡有針對特定文字的活躍缺陷回報,包括旁遮普語古木基文對疊音符與鼻化標記的處理問題。
抓取時列出四個付費方案,且疊加了促銷。Plus 折合每月 5.5 美元、按年計費 66 美元,對應月繳標價 15 美元,含每月 25 萬點數。Pro 折合每月 37.5 美元、按年計費 450 美元,對應標價 100 美元,含 200 萬點數與 3 個團隊席次。Max 折合每月 749 美元、按年計費 8,988 美元,對應標價 999 美元,含 2,500 萬點數與 10 個團隊席次。企業方案為客製、按年結算。大約 600 到 625 點數換一分鐘生成,且未用完的點數不會結轉。
隱私權政策沒有說。對政策正文的全文檢查未發現「train」「voice」「biometric」任何一個詞的出現,該政策標註的生效日期是 2024 年 8 月 28 日。這意味著在這個問題上不存在任何公開承諾,而斷言一份文件裡並不存在的保護是不對的。上傳音訊落入概括性的使用者內容類別,該類別列出的共享對象包括服務供應商、廣告、分析與業務合作方。如果這一點對你的法遵立場很重要,請直接向廠商詢問——另需注意企業方案把零資料留存單獨列為一項特性。
刪除是部分的而非徹底的。條款寫明,刪除帳號後平台會停止向其他使用者展示你的提交內容,但明確把公開提交內容排除在外,因為後者可能仍然完全可用;條款還承認可能無法從其紀錄中徹底刪除這些內容。由於所授予的授權是永久、可再授權且不可撤銷的,而公開提交內容還額外授予了市場推廣權利以及面向其他所有使用者的存取權,因此選擇私人而非公開語音欄位是一個有實質意義的決定,不是歸檔偏好。
網站頁尾寫的是 Hanabi AI Inc.,而開源授權條款要求的署名卻指向 39 AI, INC.——兩個名稱本文都如實記錄,官網並未說明兩者關係。公司宣布在成立滿一年時完成 5,200 萬美元種子輪募資,本輪的領投方之一名為 Coreline Ventures,另一家領投機構則是今日資本(Capital Today)。其自己的公告稱團隊 22 人、年度經常性收入 2,100 萬美元、平台使用者 800 萬以上、社群語音模型 200 萬以上,並具名列出執行長 Rissa Cao 與首席科學家 Shijia Liao。這些業務數字均為自報,未經獨立稽核。