Toolso.AI
Toolso.AI
所有工具分類熱門榜單最新工具價格部落格
Toolso.AI
Toolso.AI

💌訂閱 AI 工具週報

每週精選最新、最熱門的AI工具和行業動態,直達您的信箱 訂閱

Toolso.AI
Toolso.AI

發現最好的AI工具,提升你的工作效率

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

熱門分類

  • AI寫作
  • AI影象
  • AI影片
  • AI程式設計
  • 更多分類

探索發現

  • 最新收錄
  • 熱門推薦
  • 更多工具
  • 提交工具
  • 價格

關於

  • 關於我們
  • 聯絡我們
  • 部落格
  • 更新日誌

法律

  • Cookie政策
  • 隱私政策
  • 服務條款
  • 退款政策
© 2026 Toolso.AI 保留所有權利
限時推廣限時推廣加速推廣24h 優先審核 · 無需反鏈 · 30 天推薦展示$29.90到期後 $59.9010月31日後漲價至 $59.90距結束--:--:--立即提交
  1. 首頁
  2. 所有工具
  3. 開發工具
  4. Fireworks
Fireworks介面預覽
Fireworks標誌

Fireworks

Fireworks 透過按 token 計費的無伺服器 API 與按 GPU 秒計費的專屬部署提供開源模型服務,並提供託管微調,方便開發團隊訓練與託管自己的模型變體。

開發工具AI開發AI訓練平台#批次處理#大語言模型#OpenAI 兼容 API
免費試用
收藏
訪問次數
瀏覽次數
定價
免費
發布日期
2026年10月5日
網域
fireworks.ai
使用者評分

用過這個工具嗎?為它評分

為這個工具評分

Fireworks 工具資訊

免費試用
工具資訊
收藏
訪問次數
瀏覽次數
定價
免費
發布日期
2026年10月5日
網域
fireworks.ai
使用者評分

用過這個工具嗎?為它評分

為這個工具評分

推薦工具

相關工具推薦

免費試用

Fireworks 是什麼?

Fireworks(其文件中寫作 Fireworks AI)是用來執行與訓練開源 AI 模型的雲端平台。開發者可以透過 LLM 推論 API 呼叫託管模型,為自己的部署租用專屬 GPU,或以自有資料微調開源模型,並在同一套基礎設施上以成果提供服務。

廠商將平台定位為「面向專業化智慧的基礎設施」,也就是一個歸客戶所有的學習循環,把領先的開源模型與客戶資料轉化為隨每次迭代持續強化的優勢。Fireworks 並不從零打造基礎模型:共同創辦人暨執行長 Lin Qiao 曾表示,公司業務是協助企業針對特定需求微調現有模型。Lin Qiao 先前在 Meta 領導 AI 平台開發團隊。

就規模而言,獨立科技媒體於 2026 年 9 月報導,Fireworks 在 7 月宣布其年化營收已達 10 億美元,是前一年的五倍。

核心功能

無伺服器推論

  • 按 token 付費:無伺服器推論按 token 計費,提供 Priority 與 Fast 選項,API 被描述為相容 OpenAI 與 Anthropic。
  • Priority 模式:Priority 層級的優先順序高於 Standard 流量,較不容易遭到負載削減(503 server overloaded)。
  • Fast 模式:Fast 變體以每秒生成 100+ token 的吞吐量為目標;文件說明 Fast 變體並非不同的模型,模型品質維持不變。
  • 模型目錄:文件列出 100+ 個支援的模型,涵蓋文字、視覺、音訊、影像與嵌入。
  • 批次作業:Batch API 以非同步方式處理大量請求;每個作業依所選的 12、24、48 或 72 小時時限執行,作業逾時時已完成的請求會被保存。

專屬部署

  • 隨需部署:支援多區域、也支援後訓練模型的專屬部署。
  • 自訂權重:可從 Hugging Face 或其他來源上傳自己的模型(限支援的架構)。
  • 預留容量:企業版帳戶可購買預留容量,通常需承諾 1 年,以取得有保障的容量、更高的配額與更低的 GPU 小時價格。
  • 單一部署掛載多個配接器:Multi-LoRA 部署可在單一基礎模型部署上以附加形式載入最多 100 個 LoRA 模型。

訓練與微調

  • 三種入口:引導式路徑(描述任務、審閱計畫與成本、核准執行);以設定為主的路徑,由 Fireworks 負責排程與交付正式環境;程式碼路徑,你在 Fireworks 的 GPU 上自行撰寫損失函數、訓練器與 RL 迴圈。
  • 規模:監督式微調與強化微調面向參數量最高 1T+ 的模型提供。
  • Serverless Training API:共用、隨時在線的訓練器池,用於在首批支援的模型上進行 LoRA 訓練,無需佈建資源,也沒有閒置成本。

這些選項讓開源模型微調成為通往部署服務的管線,而非獨立產品:官網首頁表示每個檢查點都能在幾秒內部署到正式環境。

Nexus 與 FireRouter

  • Nexus:把開源模型與模型路由器接入程式設計代理執行框架、代理與 LLM 閘道,並為支援的無伺服器模型提供用量可見性與每位使用者的支出上限。
  • FireRouter:對外只公開一個模型 ID,並為每個新的使用者回合挑選模型,簡單回合可交給 Fireworks 的開源模型,較難的回合可交給 Claude Opus 等閉源模型。
  • 支出說法:Fireworks 將 Nexus 宣傳為閉源模型 API 的直接替代方案,可將 AI 程式設計支出降低 50% 至 75%,這是廠商提供的數字。

使用指南

典型的第一個專案會從無伺服器測試逐步走到成本控管:

  1. 新增有效的付款方式與帳單地址,然後購買額度;無伺服器、隨需部署與訓練的用量都從該餘額扣除。
  2. 使用 OpenAI Python 用戶端程式庫,修改 base URL 與 API 金鑰即可與 Fireworks 互動。
  3. 對必須撐過尖峰時段的流量,將請求的服務層級設為 Priority;對延遲敏感的功能,在有 Fast 變體時把模型 ID 切換為 Fast 變體。
  4. 設定每月支出上限。預設情況下,用量達到每月支出上限的 80% 時 Fireworks 會寄送警告郵件,也可以在帳單頁面新增更多提醒門檻。
  5. 規劃上線前執行 firectl quota list,查看帳戶目前的速率限制、GPU 配額、支出上限與用量。
  6. 需要訓練好的 LoRA 模型、自訂模型或固定版本時,建立隨需部署,而不是依賴無伺服器。

Fireworks 的使用情境與客戶案例

Fireworks 官網首頁的客戶引言是廠商挑選的推薦語,並非獨立案例研究,但可看出平台鎖定的工作負載:

  • AI 程式設計產品:Cursor 的產品長表示,Fireworks 一直是協助其大規模訓練與運行 Cursor 背後模型的關鍵夥伴,包括高吞吐量的 RL 工作負載與 Composer 的正式環境推論。
  • 更快的消費型應用:一位 Quora 產品負責人表示,遷移一個模型後回應時間加快 3 倍,該公司稱這提升了使用者互動指標。
  • 微調後的複合模型:Vercel 的技術長表示,其 v0 模型借助 Fireworks 使用了經過微調的強化學習模型,表現明顯優於 SOTA。
  • 透過 Azure 運行的企業代理:UiPath 在 Azure Foundry 上執行 Fireworks,以開源模型驅動 Autopilot 與 Delegate。
  • 以開源模型取代閉源模型:Gumloop 將公司內部一個全員使用的代理從 Opus 4.8 換成 GLM-5.2,並表示沒有人察覺到體驗上的差異。

適用人群

  • 原型開發團隊:以按 token 計費的方式在無伺服器上使用熱門模型,被定位為非常適合憑感覺的品質測試與原型開發。
  • 執行自有模型或訓練後模型的團隊:隨需部署適合自訂基礎模型、訓練好的 LoRA 模型,以及有自訂延遲需求、需要掌控硬體與副本的工作負載。
  • 受監管的企業:帳戶層級的零資料保留政策與區域鎖定推論屬於企業版功能,而非自助設定。

有兩種情況較不適合。需要固定模型版本的團隊從無伺服器獲益較少,因為無伺服器模型由 Fireworks 團隊管理,可能隨新模型發布而更新或淘汰。條款禁止未成年人使用,除非有父母或法定監護人監督。

支援平台

  • API:相容 OpenAI 與 Anthropic 的端點,現有 SDK 程式碼可直接指向 Fireworks。
  • CLI:firectl 可在終端機中建立、部署與管理資源,並可透過 Homebrew 安裝。
  • Microsoft Foundry:Fireworks AI 是 Microsoft Foundry 內的第一方推論供應商,用量透過 Azure 計費,並計入 Azure 消費承諾。
  • Foundry PayGo 邊界:Foundry 上的 PayGo 僅限 US Data Zone,PayGo 部署的吞吐量上限為每分鐘 500,000 token。
  • 區域:專屬部署可選擇 GLOBAL、US、CANADA、EUROPE 與 APAC 多區域。
  • 僅限美國的無伺服器:獨立的美國端點只在美國境內為一小批模型提供推論;僅限歐盟的無伺服器需聯絡業務。

價格套餐

計費採預付制:自動儲值功能可自動為餘額儲值,每月支出上限可封頂用量。簽約客戶可能可以改為後付費。

無伺服器推論價格

價格單位為美元 / 每 100 萬 token,依輸入 / 快取輸入 / 輸出列出,擷取於 2026 年 10 月 5 日。

模型Standard 層級Priority 層級
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

未單獨列出的文字與視覺模型依規模定價:參數少於 4B 為 $0.10,4B 至 16B 為 $0.20,超過 16B 為 $0.90,皆為每 1M token,沒有單獨的快取價格。批次推論的輸入與輸出皆按無伺服器價格的 50% 計費。自 2026 年 9 月 1 日起,已推出的僅限美國模型按基礎模型無伺服器價格的 1.5 倍定價。

隨需 GPU 價格

隨需部署按 GPU 秒計費,啟動時間不另收費。

GPU每分鐘每小時
H100 80 GB$0.134$8.00
H200 141 GB$0.134$8.00
B200 180 GB$0.217$13.00
B300 288 GB$0.250$15.00
GB300 288 GB$0.334$20.00

區域受限部署以 1.5 倍溢價定價,並需透過業務辦理。

微調價格

託管的監督式微調與偏好微調按每 1M 訓練 token 定價:

基礎模型規模LoRA SFTLoRA DPO全參數 SFT全參數 DPO
最高 16B$0.50$1.00$1.00$2.00
16.1B 至 80B$3.00$6.00$6.00$12.00
80B 至 300B$6.00$12.00$12.00$24.00
超過 300B$10.00$20.00$20.00$40.00

訓練 token 的估算方式為訓練資料集的 token 數乘以 epoch 數。Dedicated Training API 作業依隨需費率按 GPU 小時計價。

不同頁面對服務成本的說法不同。價格頁表示微調模型可按與基礎模型相同的價格提供服務,而計費 FAQ 則表示訓練好的 LoRA 模型需要專屬部署才能提供服務,按 GPU 秒計費。

額度、等級與退款

  • 起始額度:計費 FAQ 提到 $1 額度;用完後,未設定付款方式的帳戶會被暫停使用,直到新增付款方式為止。
  • 消費等級:儲值或消費 $50 額度可讓帳戶升至 Tier 2,$500 升至 Tier 3,$5,000 升至 Tier 4;等級越高,無伺服器速率限制的上限越高。
  • 量販價格:Fireworks 為大量或預付購買提供折扣。
  • 退款:服務條款規定已支付的費用不予退還,條款另有規定者除外。

Fireworks 的替代方案

  • Together AI:其定價涵蓋無伺服器推論、預配吞吐量、單一租戶 GPU 上的專屬推論,以及 LoRA 或完整微調,與 Fireworks 銷售的產品劃分相同。
  • Baseten:結合 Model APIs 與專屬部署,專屬部署只需為實際使用的運算付費、精確到分鐘,其 Basic 方案為每月 $0,按用量付費。

Fireworks 的專屬 GPU 按秒計費,而 Baseten 按分鐘計量,這項差異對短時、突發型部署影響最大。

注意事項

速率限制與容量

  • 新帳戶受到限流:沒有付款方式或沒有額度的帳戶限制為每分鐘 10 個請求;即使有付款方式與額度,帳戶整體上限也是每分鐘 6,000 個請求。
  • 自適應的無伺服器限制:限制會隨用量增減,若流量增加過快,就會收到 429。
  • 不保證成功:在無伺服器上可能遇到 429 Too Many Requests 或 503 Service Overloaded 回應,且維持在限制以內也無法避免負載削減。
  • 依模型規模的上限:生成 token 上限從參數少於 600B 模型的每分鐘 1.08M token,到 1.6T 以上參數模型的 216k 不等。
  • GPU 配額:GLOBAL 多區域的預設隨需配額為 H100、H200、B200 與 B300 各 16 顆 GPU,GB300 與 A100 起始為 0。
  • 訓練配額需綁卡:沒有付款方式時訓練 GPU 配額為 0;設定付款方式後每種類型 32 顆 GPU。

營運邊界

  • 模型下架:Fireworks 在移除無伺服器模型前至少提前 2 週通知,熱門模型的通知期更長。
  • 閒置部署:預設情況下,部署閒置 1 小時會縮減至零;最小副本數設為 0 的部署在 7 天無流量後會被刪除。
  • 可搶占容量:可搶占部署借用閒置 GPU,可能在請求進行中被無預警搶占,因此僅適用於評估與批次工作。
  • 硬性支出停止:用量達到每月支出上限的 100% 時,無伺服器推論、部署與訓練的所有 API 請求都會暫停(企業版帳戶只會收到提醒)。
  • 支出報告延遲:總支出數據可能比即時流量落後一天或更久,新推出的模型尤其如此。
  • 不符合 PCI:條款表示 Fireworks 不符合 PCI 標準,也沒有義務達到 PCI 合規。

資料保留與訓練用途

預設情況下,未經使用者明確選擇加入,Fireworks 不會記錄或儲存任何開源模型的提示詞或生成資料;但會記錄 token 數等請求中繼資料。啟用提示詞快取時,部分提示詞資料可能在揮發性記憶體中保留數分鐘。

Response API 是例外:它預設儲存對話,已儲存的對話資料會在 30 天後自動刪除。條款也將零資料保留承諾限定於推論,不涵蓋訓練、微調或代理功能等依設計會保留資料的功能。

在訓練用途上,兩份文件的措辭不同。服務條款表示 Fireworks 不會使用你的內容訓練其自有模型或改善服務。隱私權聲明表示,未經你明確選擇加入,Fireworks 不會使用提示詞、訓練資料或 API 輸入來訓練或改善其模型。就雙方而言,你擁有內容的全部權利、所有權與利益,條款將內容定義為你的輸入與輸出。

企業版管理員可以開啟帳戶層級的零資料保留政策,此政策會拒絕任何會持久保存客戶內容的操作,包括批次推論作業、微調與 RL 作業、資料集上傳與 FireRouter 虛擬模型。FireRouter 將某一回合傳給 Claude 或 GPT 時,閉源模型會在你自己的 Anthropic 或 OpenAI 帳戶上執行。

安全與合規聲明

以下為廠商聲明,並非獨立稽核:

  • Fireworks 表示已取得 ISO 27001、ISO 27701 與 ISO 42001 認證,並持有 SOC 2 Type II。
  • Fireworks 自稱符合 HIPAA。
  • 資料在傳輸中以 TLS 1.2+ 加密,靜態資料以 AES-256 加密。
  • 將推論限制在單一區域的資料駐留是企業版功能;列出的選項為 US。

FAQ

Q1. 有免費方案嗎?

在查核過的價格頁面上沒有出現免費方案。除了計費 FAQ 提到的 $1 額度外,持續使用需要付款方式與預付額度。

Q2. 微調後的 LoRA 模型能在無伺服器上提供服務嗎?

不能。LoRA 模型需要按 GPU 時間計費的隨需部署;一個部署最多可託管 100 個 LoRA 配接器,藉此分攤這筆成本。

Q3. 專屬 GPU 什麼時候比無伺服器便宜?

無伺服器推論價格按每個 token 計費,因此閒置時間不產生費用。隨需部署被描述為在高使用率下更便宜;它們按 GPU 秒計費,而非按 token。

發現類似工具?
如果你知道其他優秀的AI工具,歡迎提交給我們