Replicate 讓你透過雲端 API 執行 AI 模型,既不必理解機器學習,也不必自行維運基礎設施。一次 HTTP 請求就把輸入交給圖像、影片、音訊或語言模型,再取回結果——不必租用 GPU,也不必自己建容器。它做的事,就是把 AI 模型 API 化。
這個介面背後其實是三件事:執行別人已發布的模型、用自己的資料微調出新模型、把自己打包好的程式碼部署上去,而每一件都只需要一行程式碼。
營運主體為 Replicate, LLC.,登記地址在舊金山 101 Townsend Street。2025 年 11 月 17 日歸屬出現變動:這個「執行 AI 模型的領先平台」宣布加入 Cloudflare。產品面被明確排除在變動之外——廠商表示 API 不會改、目前在用的模型會繼續可用;收購方也給出同樣承諾,現有使用者的 API 與工作流程不會中斷。開發並未停擺,更新日誌最新一則新增了一組 Markdown 指令檔,讓程式助理掌握在該平台操作 AI 模型的專門知識。
模型目錄的規模只有廠商口徑:收購公告稱涵蓋超過 50,000 個開源模型與微調模型;本輪查核過的管道中,並未出現任何獨立計數。
一套 API 之後其實有四類對象,它們在延遲與成本上的表現並不一致:
正因為分成這四類,「平台上的一個模型」並不是單一的效能樣貌:官方模型常駐預熱、隨時回應請求,執行時不必顧慮冷啟動;而一個少人使用的社群模型,會先從零載入。
容量不必設定就能雙向伸縮:流量暴增時自動擴充,閒置時縮回到零。預設太寬鬆時,部署(deployment)這項功能可以掌控任一模型的硬體與擴縮容參數。團隊這一側則有組織(organization),用來共享模型、API token、帳務與儀表板等存取權限。
預設的安全過濾器範圍比字面窄:平台只對 SDXL 基礎模型、Flux 基礎模型,以及兩者的全部衍生微調,在網頁端啟用安全檢查器。它另留了一個出口——透過 API 執行模型時可以關閉安全檢查器——代價是 API 這條路徑上沒有保證生效的過濾。
第一次接上去並不長,但其中兩步現在便宜、之後昂貴。
可查證的能力,對應的是一組範圍不寬的工作。
同一批事實也劃出邊界:需要有保證的回應時間、單次執行超過三十分鐘,或要求產出留在平台上日後再取,都落在標準帳戶的可查範圍之外。
它適合這樣的開發團隊:想要無伺服器 GPU 推論,又不想自己扛下整套機器學習技術堆疊,並且能接受浮動帳單而非自行維運叢集。它同樣適合模型作者,因為發布與微調在這裡是第一級的操作。
有四種情況並不適合,每一條都能追回到公開條款:
一切都透過 HTTP 觸達。官方用戶端涵蓋 Node.js、Python、Swift 與 Go,另有一個代管的 MCP 用戶端;Elixir 等其他生態由社群貢獻者維護而非廠商維護,這會改變你能期待的支援程度。
模型也可以直接在站台上執行,這是動手寫程式之前查看某個模型輸入欄位最快的方式。
Replicate 價格沒有方案分級。你只為實際用量付費:一部分模型依硬體與時間計費,另一部分依輸入與輸出計費。適用哪一套計量由模型本身決定,而不是由你的帳戶決定。依時間計費時,單價跟著硬體走:
| 硬體 | 每秒 | 每小時 |
|---|---|---|
| Nvidia T4 | $0.000225 | $0.81 |
| Nvidia L40S | $0.000975 | $3.51 |
| Nvidia A100(80GB) | $0.001400 | $5.04 |
| Nvidia H100 | $0.001525 | $5.49 |
這些是每秒執行時間的單價,不是每次請求的價格:多數模型依執行時間計費,每秒單價隨所用硬體變動,因此同一句提示詞在較重的模型上更貴。依輸出計費的那一側剛好相反——官方模型改以輸出圖片數、影片輸出秒數、輸入與輸出 token 數這類可預測指標計價,公開範例從每張輸出圖片 $0.04 到每百萬輸入 token $3.75。只有在這一側,單次請求的預算才能事先算得出來;而最高的幾檔並不開放自助購買:更多多卡 H100 容量需要簽訂承諾消費合約。
在共享容量上,冷啟動是延遲問題;在專用容量上,它是計費問題。共享這一側,使用公共模型時只對實際處理請求的活躍時間付費,啟動與閒置時間免費。等待本身仍然真實——某些情況下這個過程會花上數分鐘——而且不在你的掌控之中,因為預設會與其他客戶共用硬體池,請求會進入與其他客戶請求混排的共享佇列。
把等待消掉,等於換了一套計量。在專用容量上,實例上線的全部時間都要付費:啟動的時間、等待請求的閒置時間,以及處理請求的活躍時間。快速啟動微調是例外,無論公開或私有都只依活躍處理時間計費。
免費入口存在,但既有邊界又沒有定義。部分模型可以免費執行,過一陣子之後會被要求設定帳務——額度、模型清單與時長都沒有給。未儲值的帳戶還會被限流:取得贈送額度但檔案中沒有支付方式時,速率會被限制在每秒 1 次請求、每分鐘最多 6 次請求。
付費這一側是預付制,而且會到期。已購額度自購買日起 1 年內有效,除法律另有要求外不可退款;條款也重述了到期規則:每筆用於儲值預付餘額的款項若未用盡,將在付款日起第 12 個月底到期。自動儲值設有下限——最低觸發門檻 $5、最低儲值餘額 $15——餘額一旦歸零,新工作會被擋下,正在運行的基礎設施也會被關閉。
企業條款是談出來的,而非公開的:專屬客戶經理、優先支援、更高的 GPU 上限與效能 SLA,量價折扣則與承諾消費掛鉤。
有兩個事實承擔了比較工作的大半。其一是廣度:企業使用者透過一份 API 與一份合約取得 50,000+ 個模型的存取權,這與專攻單一模態的服務不是同一種命題。其二是最便宜的組態正好是共享組態,而在那裡有時會遇到冷啟動或擴縮限制,取決於其他客戶怎麼使用該模型。
獨立來源給出的是名單而不是排名。該公司 2023 年 2 月亮相時的署名科技報導,描述了一個擁擠的市場:這家新創與 Hugging Face、OctoML,以及某種程度上的 Runway ML 等廠商競爭,後者合計募得數億美元。一場公開的開發者討論後來整理出更長的實務名單——這個領域到底有多少玩家?Replicate、RunPod、Modal、Northflank、FAL。
要區分它們,靠的是三個問題:這家服務商公開的是每秒硬體單價,還是只有依輸出計的價格;固定實例之後是否對閒置時間計費;以及它會保留你的產出,還是像這家一樣按計時器刪除。本輪沒有任何獨立基準測試達到來源門檻——檢索到的比較頁面,不是競爭平台自行發布,就是來自帶推薦連結的聚合站。
文件與合約對「失敗的執行」講法不同。計費文件稱任何模型執行失敗都不收費,而取消官方模型的執行仍可能被計費。條款則稱部分執行與失敗嘗試會依系統記錄的失敗發生節點計費。第三條規則針對串接呼叫:模型失敗時仍依本次執行時間,加上失敗前已呼叫的下游模型成本計費。這些頁面彼此不一致,而同一批日誌正是結算計費爭議時採用的紀錄,因此失敗率高的工作負載需要把適用規則落成書面。
自助方案上沒有任何東西被合約鎖住。廠商保留隨時自行變更服務的權利,包括限制或停止服務的某些功能、暫時或永久生效,且無須事先通知。加上沒有模型可用性承諾,你依賴的某個模型因此可能在沒有通知的情況下消失——所以要鎖定版本並保留退路。爭議處理同樣受限:條款適用美國加州法律,並且不允許集體仲裁程序。
統一的介面掩蓋了並不統一的授權條款:你不得違反模型所有者的開源授權限制去使用機器學習模型。寬鬆授權、僅限研究與專有條款,全都躲在同一個呼叫背後。
保留期是不對稱的。透過 API 建立的預測會在一小時的計時器上被清除,而透過網頁介面建立的預測資料則無限期保留,因此真正累積紀錄的是瀏覽器這條路徑。監控寫得很直白:廠商保留監控你使用服務情況的權利以確保符合政策,其中包含對內容與行為的自動與人工審查。隱私權政策另外提醒,上傳的訓練資料可能包含各類資訊,其中部分在多部隱私法下可能被視為「敏感」。
產出權利很寬,但附帶條件。廠商把輸出的全部權利、所有權與利益(如有)授予你,包括銷售或發表等商業用途,但以適用的第三方條款為前提——這個前提就是產生它的那個模型所附的授權。作為交換,你為自己的輸入授予一份授權,範圍限於提供輸出、訓練並產生客戶衍生模型、依條款提供服務,以及建立並彙編 Resultant Data。至於這些輸入會不會被用來訓練廠商自有的模型,已公開的政策兩邊都沒有說明,這裡也不替它補上。
平台聲明其不依美國各州隱私法的定義出售或共享個人資訊,政策同時表示不主動蒐集 16 歲以下兒童的個人資訊。
有的是一份有邊界的免費額度,不是免費方案:部分模型可以免費執行,直到你被要求設定帳務,而額度、時長與模型清單都沒有公布。在檔案中綁定支付方式之前,吞吐會被限制在每秒 1 次請求。
在公共模型上不會,那裡啟動與閒置時間免費——但固定容量之後情況就變了,專用實例與部署同樣會對啟動與閒置時間計費。
會。額度自購買日起一年內有效,合約寫明每筆款項若未用盡,將在付款後第 12 個月底到期。全部預付餘額均不可退款,法律另有要求或本協議另有明文規定者除外。
透過 API 呼叫時預設不會:輸入、輸出、檔案與日誌會在一小時後刪除,要留的東西必須自己複製出去。在瀏覽器裡建立的預測則會一直保留,直到你手動刪除。