Fireworks(其文件中寫作 Fireworks AI)是用來執行與訓練開源 AI 模型的雲端平台。開發者可以透過 LLM 推論 API 呼叫託管模型,為自己的部署租用專屬 GPU,或以自有資料微調開源模型,並在同一套基礎設施上以成果提供服務。
廠商將平台定位為「面向專業化智慧的基礎設施」,也就是一個歸客戶所有的學習循環,把領先的開源模型與客戶資料轉化為隨每次迭代持續強化的優勢。Fireworks 並不從零打造基礎模型:共同創辦人暨執行長 Lin Qiao 曾表示,公司業務是協助企業針對特定需求微調現有模型。Lin Qiao 先前在 Meta 領導 AI 平台開發團隊。
就規模而言,獨立科技媒體於 2026 年 9 月報導,Fireworks 在 7 月宣布其年化營收已達 10 億美元,是前一年的五倍。
這些選項讓開源模型微調成為通往部署服務的管線,而非獨立產品:官網首頁表示每個檢查點都能在幾秒內部署到正式環境。
典型的第一個專案會從無伺服器測試逐步走到成本控管:
firectl quota list,查看帳戶目前的速率限制、GPU 配額、支出上限與用量。Fireworks 官網首頁的客戶引言是廠商挑選的推薦語,並非獨立案例研究,但可看出平台鎖定的工作負載:
有兩種情況較不適合。需要固定模型版本的團隊從無伺服器獲益較少,因為無伺服器模型由 Fireworks 團隊管理,可能隨新模型發布而更新或淘汰。條款禁止未成年人使用,除非有父母或法定監護人監督。
計費採預付制:自動儲值功能可自動為餘額儲值,每月支出上限可封頂用量。簽約客戶可能可以改為後付費。
價格單位為美元 / 每 100 萬 token,依輸入 / 快取輸入 / 輸出列出,擷取於 2026 年 10 月 5 日。
| 模型 | Standard 層級 | Priority 層級 |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
未單獨列出的文字與視覺模型依規模定價:參數少於 4B 為 $0.10,4B 至 16B 為 $0.20,超過 16B 為 $0.90,皆為每 1M token,沒有單獨的快取價格。批次推論的輸入與輸出皆按無伺服器價格的 50% 計費。自 2026 年 9 月 1 日起,已推出的僅限美國模型按基礎模型無伺服器價格的 1.5 倍定價。
隨需部署按 GPU 秒計費,啟動時間不另收費。
| GPU | 每分鐘 | 每小時 |
|---|---|---|
| H100 80 GB | $0.134 | $8.00 |
| H200 141 GB | $0.134 | $8.00 |
| B200 180 GB | $0.217 | $13.00 |
| B300 288 GB | $0.250 | $15.00 |
| GB300 288 GB | $0.334 | $20.00 |
區域受限部署以 1.5 倍溢價定價,並需透過業務辦理。
託管的監督式微調與偏好微調按每 1M 訓練 token 定價:
| 基礎模型規模 | LoRA SFT | LoRA DPO | 全參數 SFT | 全參數 DPO |
|---|---|---|---|---|
| 最高 16B | $0.50 | $1.00 | $1.00 | $2.00 |
| 16.1B 至 80B | $3.00 | $6.00 | $6.00 | $12.00 |
| 80B 至 300B | $6.00 | $12.00 | $12.00 | $24.00 |
| 超過 300B | $10.00 | $20.00 | $20.00 | $40.00 |
訓練 token 的估算方式為訓練資料集的 token 數乘以 epoch 數。Dedicated Training API 作業依隨需費率按 GPU 小時計價。
不同頁面對服務成本的說法不同。價格頁表示微調模型可按與基礎模型相同的價格提供服務,而計費 FAQ 則表示訓練好的 LoRA 模型需要專屬部署才能提供服務,按 GPU 秒計費。
Fireworks 的專屬 GPU 按秒計費,而 Baseten 按分鐘計量,這項差異對短時、突發型部署影響最大。
預設情況下,未經使用者明確選擇加入,Fireworks 不會記錄或儲存任何開源模型的提示詞或生成資料;但會記錄 token 數等請求中繼資料。啟用提示詞快取時,部分提示詞資料可能在揮發性記憶體中保留數分鐘。
Response API 是例外:它預設儲存對話,已儲存的對話資料會在 30 天後自動刪除。條款也將零資料保留承諾限定於推論,不涵蓋訓練、微調或代理功能等依設計會保留資料的功能。
在訓練用途上,兩份文件的措辭不同。服務條款表示 Fireworks 不會使用你的內容訓練其自有模型或改善服務。隱私權聲明表示,未經你明確選擇加入,Fireworks 不會使用提示詞、訓練資料或 API 輸入來訓練或改善其模型。就雙方而言,你擁有內容的全部權利、所有權與利益,條款將內容定義為你的輸入與輸出。
企業版管理員可以開啟帳戶層級的零資料保留政策,此政策會拒絕任何會持久保存客戶內容的操作,包括批次推論作業、微調與 RL 作業、資料集上傳與 FireRouter 虛擬模型。FireRouter 將某一回合傳給 Claude 或 GPT 時,閉源模型會在你自己的 Anthropic 或 OpenAI 帳戶上執行。
以下為廠商聲明,並非獨立稽核:
在查核過的價格頁面上沒有出現免費方案。除了計費 FAQ 提到的 $1 額度外,持續使用需要付款方式與預付額度。
不能。LoRA 模型需要按 GPU 時間計費的隨需部署;一個部署最多可託管 100 個 LoRA 配接器,藉此分攤這筆成本。
無伺服器推論價格按每個 token 計費,因此閒置時間不產生費用。隨需部署被描述為在高使用率下更便宜;它們按 GPU 秒計費,而非按 token。