Voice.ai 是一個語音技術平台,營運主體為美國公司 Voice AI, Inc.,其網站每一頁的頁尾都標註 Voice.ai® 與 Voice Universe® 為註冊商標。這個產品最初的形態比今天窄得多:它是一個桌面應用程式,讓遊戲玩家與實況主在 Discord 或遊戲語音頻道講話時即時替換自己的音色。那個最初的即時變聲器至今仍在,也仍然是多數人造訪這個網域的理由。但平台如今在同一個帳號底下販售四類不同的東西,而弄清楚自己真正需要哪一類,是註冊之前最值得先想明白的事。
這四條產品線分別是即時變聲器、文字轉語音引擎、即時聲音複製,以及電話語音代理。官網首頁標題把其中兩條並排放在一起——「免費 AI 變聲器與語音代理平台」——這是相當罕見的組合,因為這兩類受眾幾乎沒有交集。一邊是想在 Minecraft 伺服器裡聽起來像卡通角色的青少年,另一邊是希望凌晨三點的業務來電也有人接的營運主管。Voice.ai 用同一套程式碼與同一份點數餘額服務兩者,這種雙重身分解釋了這個產品用起來的許多感受。
公司對自身技術路線的界定,比「我們能複製任何聲音」要更窄也更有意思。創辦人兼執行長 Heath Ahrens 對 TechCrunch 的說法是:其語音到語音 AI 的核心價值主張並不是完美複製某個特定的人,而是在替換音色的同時保留說話者語音中的核心要素——情緒、節奏與重音——從而即時產生一個全新的結果。這是刻意與那些把「還原度」當作全部賣點的語音轉換公司拉開距離。Voice.ai 最佳化的目標是轉換後聽起來自然且能即時進行,而不是複製結果在鑑識意義上難以分辨。
創辦團隊的背景有助於理解這家公司的主張。Ahrens 於 2007 年創辦 iSpeech,官網 About 頁稱其為首個雲端文字轉語音平台,並在 2009 年推出 DriveSafe.ly,這是第一個把簡訊朗讀出來的應用程式。他此前還創辦過人臉辨識公司 Haystack。一位做了近二十年語音介面的創辦人,會讓這家公司近期轉向開發者 API 與企業語音代理這件事,看起來不像轉型,更像回到主場。
有兩個數字可以給出規模感,但兩者都有明確的時間點。TechCrunch 在 2023 年 6 月報導其首輪外部募資時,Voice.ai 擁有超過 48 萬使用者與超過 5 萬個聲音濾鏡,此前完全靠口碑成長與 300 萬美元自籌資金支撐,Discord 社群超過 12 萬人。當時 Mucker Capital 與 M13 領投 600 萬美元,M13 至今仍將其列為種子階段投資項目。而目前的 App Store 頁面描述的是一個超過 2 萬個使用者產製聲音的社群庫。這些數字統計的是不同時間點的不同對象,不應被拼接成單一趨勢線。
真正讓 Voice.ai 有別於常規文字轉語音廠商的一點是:它的聲音庫在很大程度上並不屬於它自己。Voice Universe 是一個社群庫,使用者把自己製作的聲音上傳進去,其他使用者再從中取用。這個名稱被註冊為商標,足以說明它在公司身分認同中的位置。這種形態更接近一個交易市集或模組社群,而不是一份經過策展的官方音色目錄,它同時帶來了這個平台最大的優勢與最棘手的問題。
優勢是廣度與速度。一個由數萬名貢獻者共建的目錄,其成長速度與長尾覆蓋是任何內部錄音室都難以企及的。問題則出在品質變異與來源合法性上。因為任何人都可以貢獻,品質參差不齊;有第三方評測者觀察到音質普遍發飄,而所謂的動漫少女音色不少其實只是做了音高調整。又因為上傳物由使用者產製,「每個聲音是否取得當事人同意」這個問題落在上傳者身上而非平台身上,這也正是服務條款要花大量篇幅處理這個問題的原因。
即時變聲是最初的產品,也是要求最高的一項。在桌面端它以 Live Mode 的形式運行,在本機顯示卡上完成語音處理,再透過 Ahrens 所說的「虛擬音訊線」把變換後的音訊送入其他應用程式。這種本機處理架構是延遲低到足以支撐對話的原因,同時也意味著硬體門檻是實打實的而非象徵性的。
官方 FAQ 在這件事上罕見地坦率。它設有一個專門條目叫「使用 Live Mode 所需的最低 GPU 是什麼?」,另有一條獨立的警告訊息條目「警告!您的 GPU 不支援 Live Mode!」。廠商不會為一種硬體故障模式專門撰寫文件化的錯誤提示,除非撞上它的使用者數量相當可觀。有第三方評測指出,顯示卡低於 Nvidia GTX 980 或 AMD RX 580 這一檔的機器會出現卡頓與音訊撕裂,並引述一位使用者發現該應用程式占用了其百分之八十七的顯示卡資源。把 Live Mode 當作一項有硬體下限的功能來看待,而不是一項人人可用的通用能力。
文字轉語音引擎是平台近期投入最重的部分,也是定價模型中的主要計量對象。官網稱支援超過 15 種語言,並逐一列出:英語(美式)、法語、印地語、烏克蘭語、日語、韓語、瑞典語、西班牙語(拉美)、葡萄牙語(巴西)、中文、荷蘭語、土耳其語、德語與義大利語。官方表述的目標是把一個既定音色在地化到任意口音或語言,也就是說音色身分與語種被當作可分離的兩個維度處理。
付費檔補上了免費檔所扣留的若干實用必需項。免費檔單次轉換上限為 500 字元,大約相當於一個短段落;Starter 檔把上限提到 5,000 字元,並且關鍵性地解鎖了下載產生檔案這個動作本身。此外還有一個更輕量的入口叫 TTS Lite,在網站導覽中標註為新增;Starter 檔起還包含一個 Text to Speech Studio。
聲音複製被做成了按檔位分配的配額,而不是一項無限量的能力,這讓我們很容易讀出公司預期每類客戶會用到多少。免費檔明確寫著「無即時聲音複製」。Starter 檔含 5 個,Launch 檔 10 個,Core 檔 50 個,Scale 檔 200 個,Business 檔則達到 2,200 個。這道配額階梯是判斷每一檔面向誰設計的最清晰訊號之一。
有一個細節值得特別標出,因為官網自己的兩個頁面互相矛盾。首頁稱只需 10 秒音訊即可以驚人的真實度複製聲音,而專門的聲音複製頁寫的是僅需 15 秒即可完成複製。兩者都是同一時間發布的官方表述,彼此沒有交叉引用,也沒有對這個差距作出任何說明。建議按較長的那個數字來規劃,把較短的那個視為行銷口徑的下限而非技術規格。
語音代理是最新的一條產品線,也是目前承載商業重量最大的一條,它排在網站導覽第一位並標註為新增。其主張是讓代理接管來電與去電,使企業不再漏接;公司的描述是代理可以自動撥打與接聽電話、回答問題、預約行程並端到端管理整段對話。點名的整合對象包括 Salesforce、HubSpot、Zendesk 與 Slack。
讓這條產品線顯得可信而非只是一個著陸頁的,是它按電話業務特有的單位來計量。方案之間的差異體現在並行通話數與電話號碼數量上:Starter 檔 2 路並行、1 個號碼,Launch 檔 4 路、3 個號碼,Core 檔 8 路、10 個號碼,Scale 檔 16 路、20 個號碼,Business 檔則是 30 路並行與 50 個號碼。這些是真實通話平台才會有的約束,不是展示品的參數。
在四條主線之外,網站還託管了九個免費的瀏覽器端音訊工具:文字轉語音、線上變聲器、音訊增強、人聲移除、回音移除、AI 分軌、歌曲調性與 BPM 偵測、殘響移除,以及音訊格式轉換。它們的作用更像獲客入口而不是業務線,並且同樣透過點數計量:免費檔限制單次處理 5 分鐘,隨檔位逐級上升至 180 分鐘。
API 是一條真實的產品線而非一句承諾,證據在細節而不在宣稱。開發者頁面揭露了三類介面——文字轉語音、語音代理與聲音複製——對應的是位於 dev.voice.ai/api/v1/tts/speech 的真實端點,可執行的 Python 範例中帶有具名模型識別碼 voiceai-tts-v1-latest。配套提供 Python 與 TypeScript 兩套 SDK 以及 REST 範例,涵蓋網頁、iOS 與 Android,並聲明相容 LiveKit 與 Pipecat 這兩個即時語音工程師真正在用的開源框架。
平台宣傳對話互動的回應時間低於 150 毫秒。這是廠商自報數字,公布時未附測試條件,也沒有第三方基準,因此應當視為設計目標而非已驗證的實測值。部署形態提供四種:雲端託管 API、地端私有化部署、位於客戶自有 VPC 的私有雲,以及低延遲本機部署。API 另支援 MCP 相容的代理工作流、用於動態知識接入的 RAG 整合、工具呼叫,以及在音訊產生完成、代理回應回呼、對話狀態更新、錯誤與重試通知等時機觸發的 webhook。
有一個前置條件很容易被忽略,而發現得晚代價不小。服務條款寫明,商業、企業、API 或其他商業用途需要與 Voice.ai 另行簽署協議。從自助流程裡拿到一個 API key,並不等於已經在合約層面獲准以此發布產品。
遊戲、實況與虛擬主播。 這是平台的歷史核心,至今仍是其最大的真實受眾。TechCrunch 描述其被遊戲玩家、內容創作者與虛擬主播廣泛採用,涵蓋 TikTok、Zoom、Discord、Minecraft、GTA5、Fortnite、Valorant、英雄聯盟、Among Us、Skype 與 WhatsApp。官方 FAQ 則以逐個應用程式的接入排障條目佐證這一點,涵蓋 Discord、Skype、WhatsApp、Zoom、PUBG、Fortnite、Google Meet、英雄聯盟、魔獸世界、Among Us、Minecraft、TeamSpeak、Telegram 與 Viber。如果你的使用場景在這份清單裡,說明已經有人替你把故障模式記錄下來了。
來電與去電處理。 語音代理這條線瞄準的是那些因漏接電話而流失商機的企業。並行數與號碼數的分檔讓規模評估可以做得比較誠實:一家正在試水的單點門市完全裝得進 Starter 檔的 2 路並行,而需要 50 個號碼的營運規模則屬於 Business 檔的範疇。
配音與旁白製作。 聲音複製頁點名了 Podcast、電子遊戲與專業配音三類場景,並稱可以在不開口說話的情況下產生數千小時的配音內容。真正讓這件事可行的門檻在 Starter 檔,因為檔案下載與商用授權是從這一檔才開始提供的——沒有下載能力,免費檔無法接入任何真實的生產流程。
多語系在地化。 由於音色身分與語種被當作可分離的維度,同一個音色可以在十四個具名語言之間做口音或語種的在地化。對於需要在多個市場維持同一套頻道人設的創作者而言,這比每種語言各挑一個不相干的庫存音色要有用得多。
無障礙與身分表達。 倫理頁明確點名了兩個群體。它稱這項技術能讓跨性別群體在不進行嗓音訓練或醫療介入的前提下取得自己期望的聲音,並稱對於因喉癌、漸凍症或帕金森氏症等疾病而失聲的人群,本產品相較傳統文字轉語音是一種潛在的改進。TechCrunch 獨立佐證了前一類使用者,並將其與出於隱私保護的使用者、以及探索全新線上人格的使用者並列為新興族群。
出於隱私考量的聲音遮蔽。 這是與娛樂用途截然不同的一類需求:有人希望參與語音聊天但不暴露自己的真實嗓音。公司「保留情緒與節奏、只替換音色」的技術取向,恰好比機械式濾波器更適合這個目的。
為複製錄製乾淨的素材。 複製品質的上限由來源素材決定。一個安靜的房間、與麥克風保持穩定的距離、以及朗讀自然語句而非孤立詞表,得到的模型明顯優於在背景噪音中錄下的短片段。
給複製的素材長度留出餘量。 鑑於官網自己給出的兩個最低時長(10 秒與 15 秒)互相矛盾,應把它們都當作下限看待。更長、語音內容更多樣的樣本能給模型更充分的音素涵蓋。
是否公開自己聲音的複製品,要慎重決定。 上傳意味著這個聲音會進入一個供他人取用的庫。Comparitech 給出的核心安全建議就是不要上傳基於本人聲音訓練的模型,理由是它可能被他人用於語音詐騙——同時該文也說明這是聲音複製類平台的共通問題,並非本產品獨有。在假定某個複製品是私有的之前,請先檢查帳號的可見性設定。
檢查 metamodel 訓練開關。 條款寫明使用服務即表示同意公司將你的硬體用於 metamodel 訓練與運算,並稱所有使用者可隨時關閉該功能。條款沒有說明這個開關預設是開還是關,因此請自行核實,不要想當然。
如果一邊打遊戲一邊變聲,要給顯示卡留餘量。 Live Mode 與遊戲爭搶同一張顯示卡。在一張本就吃緊的顯示卡上,結果會是遊戲掉幀與音訊失真同時發生。
訂閱之前就核實,而不是之後。 多位獨立評測者批評的是同一件事:安裝完成之前看不到價格。既然定價頁本身是公開且詳細的,那就在安裝任何東西之前,先在瀏覽器裡把它讀一遍。
保存第三方聲音的授權憑證。 如果你複製了他人的聲音,條款要求取得該人的明確法律授權,而賠償條款把出錯的後果放在了使用者身上。留存書面許可,是這項要求在實務中的具體形態。
不要用產出物去搭建競品語音產品。 條款明確禁止利用其輸出去訓練、開發或改進任何語音模型,禁止用於建構新的合成聲音或衍生產品,也禁止用於支援競爭性產品。
擁有合格硬體的遊戲玩家、實況主與虛擬主播 是即時能力一側最契合的受眾。如果你有一張中階或更好的遊戲顯示卡,並且常泡在 Discord 或多人語音裡,這裡就是這個產品的主場,社群聲音庫在這個領域也最為豐富。
中等產量的配音內容創作者 從 Starter 檔起就能得到較好的支撐,因為下載與商用授權從這一檔開始提供。十四個具名語言使它對跨市場發布的創作者具備現實可行性。
正在流失來電的小型企業 是語音代理這條線的目標客戶。較低檔位把一次真實試點的成本壓到了可承受範圍——每月 5 美元取得 1 個號碼與 2 路並行,是在正式投入之前驗證自動接聽是否適合自身業務的現實做法。
建構即時語音功能的開發者 可以拿到一套有文件、有具名 SDK 與框架相容性的 API,前提是按條款要求另行簽署商業協議。
因身分認同或無障礙需求而需要另一個聲音的族群,在倫理頁中被明確提及,TechCrunch 也獨立地把這一類辨識為成長中的使用者群體。
不建議選用的情況: 使用內顯或老舊筆電卻想要即時變聲的人,因為沒有任何方案能補償硬體下限;需要在合約上確保產出物權屬與不侵權的人,因為條款恰恰對此作出免責;以及無法接受嚴格不可退款政策的人。
桌面應用程式是功能最完整的用戶端,也是唯一能執行 Live Mode 即時變換的地方,透過官網自有的安裝檔分發。它的能力上限由機器顯示卡決定,而不僅僅由訂閱檔位決定。
網頁端涵蓋文字轉語音、語音代理控制台與九個線上音訊工具,因為處理發生在伺服器端,所以對本機硬體沒有要求。這是做前期評估最合適的入口。
行動端方面,iOS 應用程式由 Voice AI Inc. 發布。根據蘋果官方介面資料,其評分為 4.0 分、共 189 則評分,內容分級 12+,免費下載,要求 iOS 18.0 或更高版本,首次發布於 2023 年 5 月,2026 年 7 月更新至 2.0.5 版。有一處能力落差被公司自己的 FAQ 記載在案:其中設有「能否用手機版做即時變聲」與「為什麼手機版還沒有即時變聲」兩個條目,因此行動端與桌面端並不對等。TechCrunch 在 2023 年的報導曾描述其涵蓋 Mac、PC、Android 與 iOS;而目前官網的下載入口呈現的是 Windows 安裝檔與 App Store 連結,Android 端的現狀在撰寫時無法從官方管道確認,建議直接查看官網。
程式化接入方面,API 涵蓋網頁、iOS 與 Android,部署形態包括雲端託管、地端私有化、客戶自有 VPC 私有雲,以及低延遲本機部署。
定價在官網定價頁公開,結構為按月點數額度計量的七個檔位,年繳標註為贈送兩個月。
| 檔位 | 月費 | 每月點數 | 即時聲音複製 | 並行通話 | 電話號碼 |
|---|---|---|---|---|---|
| Free | $0 | 5k | 無 | — | — |
| Starter | $5 | 15k | 5 | 2 路 | 1 個 |
| Launch | $24(首月 $12) | 200k | 10 | 4 路 | 3 個 |
| Core | $99 | 1M | 50 | 8 路 | 10 個 |
| Scale | $330 | 4M | 200 | 16 路 | 20 個 |
| Business | $880 | 22M | 2,200 | 30 路 | 50 個 |
| Enterprise | 客製 | 客製 | — | — | — |
點數體系是真正值得理解清楚的部分,因為點數是一種跨能力共用的單位,在不同能力上按不同匯率消耗。在 Core 檔上,同樣的一百萬點數可以換成 1,000 分鐘文字轉語音,或 1,000 分鐘語音代理通話,或 15,000 分鐘音訊工具處理。文字轉語音與代理通話的單價彼此相當,而音訊工具處理的每分鐘成本大約只有前兩者的十五分之一。免費檔的額度在實際使用中相當有限:5,000 點數只能換 5 分鐘文字轉語音或 3 次音訊工具使用。
其他與檔位掛鉤的限制,對體驗的影響不亞於點數數量本身。單次轉換字元數從免費檔的 500 提升到 Starter 檔起的 5,000。音訊工具的單次時長上限從免費檔的 5 分鐘依次升至 10、20、60 直到 180 分鐘。文字轉語音的並行產生數從 Starter 檔的 3 路增加到 Scale 與 Business 檔的 15 路。Enterprise 檔另增 DPA 與 SLA 的客製條款、面向 HIPAA 客戶的 BAA、客製 SSO、更高並行上限與優先支援。
訂閱之前有兩件關於付款的事需要強調。條款寫明,除購買時另有說明或法律另有要求外,所有款項一律不可退款——訂閱費、按量計費與一次性購買皆然,例外情況由公司自行斟酌處理且並無義務。另外,多位獨立評測者反映價格要到安裝之後才會顯示;而公開的定價頁本身讓接受這一點變得沒有必要:先讀它。
ElevenLabs 是複製還原度與表現力型文字轉語音的參照系,TechCrunch 的報導把 Voice.ai 歸入同一大類的同時,也提到 ElevenLabs 在聲音複製上以「好得令人不安」而知名。如果你的需求是最高品質的合成旁白且不需要即時變換,那它是更直接的選擇。
Respeecher 處在專業語音到語音的另一端,在影視製作領域有實績。當需求是把某個特定目標說話人還原到廣播級標準、而非即時變換音色時,它是更貼切的對照對象。
Voicemod 是即時遊戲變聲一側最直接的競品,Trustpilot 頁面的「其他人也看了」欄目正把兩者並列,顯示 Voicemod 為 1.7 分、456 則評論,而 Voice.ai 為 2.0 分、233 則評論。兩者分數都不高,且兩個檔案都存在下文討論的抽樣問題。
Murf 與 Acapela 被 TechCrunch 列為語音模擬領域的既有廠商,它們更接近傳統配音製作,而非即時變換。
專門的語音代理平台 是電話業務這條線的相關對照。如果唯一的需求是通話自動化、變聲完全無關,那麼應當在並行能力、電話功能與合規文件這幾個維度上,把 Voice.ai 的代理檔位與專注做對話平台的產品做比較,而不是比聲音庫大小。
即時變換存在硬體下限。 Live Mode 依賴本機顯示卡處理。公司同時記載了最低 GPU 要求與一條專門的「顯示卡不受支援」警告,第三方測試則指出在大致低於 GTX 980 或 RX 580 這一檔的硬體上會出現卡頓,有使用者回報顯示卡占用達到 87%。沒有任何訂閱檔位能解除這個約束。
行動端與桌面端不對等。 官方 FAQ 自己提出並回答了「為什麼手機版還沒有即時變聲」。任何以手機端即時變換為核心場景的使用者,都應在付費前確認目前狀態。
官方對複製所需時長給出了兩個互相矛盾的數字。 首頁是 10 秒,複製頁是 15 秒,同期發布且未作調和。
社群評分偏低,且抽樣並不中性。 Trustpilot 顯示 2.0 分、233 則評論,其分布高度兩極:82% 為一星,14% 為五星,中間幾乎是空的。該檔案自 2023 年 8 月起已被企業認領,公司主動邀請客戶評價,並回覆了 100% 的負評——由邀評驅動的樣本與自然形成的樣本存在系統性差異,因此這一分數應當與其他管道並列解讀,而不是取而代之。App Store 上 4.0 分、189 則評分的結果在樣本量相當的情況下明顯更正面;而 Trustpilot 對 59 則近期評論的摘要,集中在自動續訂、意外續費扣款與客服無回應上,而非核心音質問題。
關於計費的投訴在多個獨立信源之間高度一致。 Comparitech 點名了安裝後才顯示訂閱價格,以及嚴格而繁瑣、需要另行註冊的退款流程。Onerep 回報了定價與試用額度說明不清,以及使用者在取消後仍被扣費的情況。條款本身確認了不可退款是預設狀態。
產品被描述為仍處於 beta 階段。 Onerep 在 2026 年 1 月的評估中指出,截至 2026 年 Voice.ai 仍處於 beta,並以此解釋使用者遇到的種種問題。
商用權利的表述前後不一致。 定價頁把商用授權列為 Starter 檔起的權益,而條款兩處寫明服務僅供個人非商業用途,且商業、企業、API 或其他商業用途需另行簽署協議。官網沒有解釋兩者如何銜接。任何計劃商業化部署的人,都應當把這一點以書面形式確認下來。
對產出物與聲音資產不提供任何擔保。 條款寫明公司不保證任何產出物或聲音資產不侵權、已獲授權或適合特定用途,並聲明平台上所有聲音均由使用者產製、公司對此不承擔責任。賠償條款把第三方權利主張的後果放在使用者一側。
你的輸入會被用於訓練模型。 上傳的輸入會授予一項永久、不可撤銷、全球、免權利金、可再授權的授權,其用途明確包含訓練與改進公司模型以及開發新產品。公司確實承諾不會在未獲明確許可的情況下單獨商業化你的聲音,但這個承諾比「不用於訓練」要窄得多。
貢獻運算資源是使用條件的一部分。 使用服務即附帶同意公司將你的硬體用於 metamodel 訓練,可隨時關閉,但未說明預設狀態。
隱私文件缺乏具體資訊。 Onerep 回報稱其未說明加密方式、未給出保留期限,且加州以外的使用者沒有資料刪除選項。Comparitech 則指出該服務不回應 Do Not Track。不過 Comparitech 的總體結論仍是:在採取一定預防措施的前提下產品是安全的,其未發現資料外洩或法律訴訟。
合規聲明沒有配套證據。 官網稱完全符合 GDPR、SOC 2、HIPAA 及所有主要企業法規,但未公布稽核報告或認證編號。企業採購方應當索取相應的底層文件。
年齡與司法管轄。 使用要求年滿 18 歲。管轄法為德拉瓦州法律,並由德拉瓦州法院專屬管轄——這對美國境外使用者是一個實質性的考量。
確實存在一個真正的免費檔,但它很窄。它每月提供 5,000 點數,約合 5 分鐘文字轉語音或 3 次音訊工具使用;單次轉換上限 500 字元;不含任何即時聲音複製;並且不允許下載產生的檔案。付費檔從每月 5 美元起。多位獨立評測者批評過「免費變聲器」的宣傳與付費牆之後內容之間的落差,因此應把免費檔視為評估手段,而不是一個可用的工作方案。
這一點確實存在歧義,值得在依賴它之前先以書面形式釐清。定價頁把商用授權列為 Starter 檔起就包含的權益。而服務條款在兩個不同位置寫明,服務僅供個人非商業用途,且商業、企業、API 或其他商業用途需與公司另行簽署協議。官網沒有調和這兩種表述。此外條款還免除了「產出物不侵權或已獲授權」這一層擔保。
需要。條款只在三種條件下允許上傳或產生音訊內容:使用你本人的聲音、取得被使用聲音者的明確法律授權,或你的用途在適用法下明確許可(例如戲仿或諷刺)。以欺騙、詐欺或誤導為目的冒充真實個人——無論在世還是已故——都被禁止,可能導致立即終止存取、法律行動以及配合執法機關。這裡要注意與 App Store 描述之間的落差:商店文案以「聽起來像任何人,從名人到虛構角色」為賣點,但真正具有約束力的是條款而非商店文案。
不可以,這一點常常讓人措手不及。條款設有名為「No License to Voices」的專條,寫明不向使用者授予平台上任何聲音、聲音模型、聲音複製品或聲音身分的任何權利,其中包括其他使用者上傳的聲音;並且某個聲音資產處於公開可見狀態,並不等於授予了使用、複製、散布或商業化的許可。在 Voice Universe 中可見,不構成一份授權。
需要一張獨立顯示卡,而且效能要說得過去。Live Mode 在顯示卡上本機處理音訊,官方 FAQ 同時記載了最低 GPU 要求與一條針對不受支援顯示卡的明確警告。第三方測試報告稱,大致低於 Nvidia GTX 980 或 AMD RX 580 這一檔的硬體會產生卡頓與斷續的輸出,有使用者回報顯示卡占用達 87%。而伺服器端能力——文字轉語音、音訊工具與語音代理——則沒有這類要求。
官網稱支援超過 15 種語言,並具名列出英語(美式)、法語、印地語、烏克蘭語、日語、韓語、瑞典語、西班牙語(拉美)、葡萄牙語(巴西)、中文、荷蘭語、土耳其語、德語與義大利語,並稱可以把某個既定音色在地化到另一種口音或語言。
公司在其安全頁面上直接回應了這兩項指控,稱應用程式會定期送交包括 McAfee、Google 與 Avast 在內的防毒廠商檢測,並公布 VirusTotal 結果;同時稱其分散式運算功能與加密貨幣或挖礦毫無關係,被貢獻的運算資源用於建構聲音、訓練模型,以及為運算能力較弱的裝置處理語音。兩份獨立評估大體認同:Comparitech 的結論是在採取預防措施的前提下產品是安全的,未發現資料外洩或法律訴訟;Onerep 的結論是它既不是病毒,也不是挖礦程式,使用也不違法。但兩者都就計費透明度與隱私文件提出了另一層面的疑慮,而 Comparitech 的主要安全建議是避免上傳基於本人聲音訓練的模型。
上傳的輸入會授予公司一項永久、不可撤銷、全球、免權利金、可再授權的非專屬授權,涵蓋服務營運、訓練與改進其模型,以及開發新功能與新產品。公司聲明不會在未獲明確許可的情況下單獨商業化你的聲音。另外,使用該服務附帶同意將你的硬體用於 metamodel 訓練,該功能可隨時關閉。第三方評測者指出,其隱私政策未說明加密方式或保留期限,且刪除權僅面向加州居民提供。
預設情況下不可以。條款寫明,除購買時另有說明或適用法另有要求外,所有款項均不可退款,包括訂閱費、按量計費與一次性購買;例外由公司自行斟酌決定,且沒有義務給予。獨立評測者形容其退款流程嚴格且需要另行註冊,而訂閱與續費相關的投訴,正是 Trustpilot 近期評論摘要中最集中的主題。
主要差別在於各自最佳化的目標。Ahrens 對此有過明確表述:其核心價值主張不是完美複製某個特定的人,而是在即時替換音色的同時,保留說話者的情緒、節奏與重音。ElevenLabs 與 Respeecher 是圍繞「對目標音色的還原度」為成品內容而建構的。Voice.ai 則圍繞即時變換、社群共建的聲音庫,以及如今的電話語音代理而建構。如果你需要把某一位特定說話人還原到廣播級水準,那些專門廠商更合適;如果你需要在遊戲或通話中即時聽起來像另一個人,這裡才是它的主場。