Fireworks(其文档中写作 Fireworks AI)是一个运行和训练开源 AI 模型的云平台。开发者可以通过 LLM 推理 API 调用托管模型,为自己的部署租用专属 GPU,或用自有数据微调开源模型,并在同一套基础设施上用成果提供服务。
厂商把平台定位为“面向专业化智能的基础设施”,即一个归客户所有的学习闭环,把领先的开源模型与客户数据转化为随每次迭代不断强化的优势。Fireworks 并不从零构建基础模型:联合创始人兼 CEO Lin Qiao 曾表示,公司的业务是帮助企业针对特定需求微调现有模型。Lin Qiao 此前在 Meta 领导 AI 平台开发团队。
就规模而言,独立科技媒体在 2026 年 9 月报道称,Fireworks 于 7 月宣布其年化收入已达 10 亿美元,是前一年的五倍。
这些选项让开源模型微调成为通往部署服务的流水线,而不是独立产品:官网首页称每个检查点都能在几秒内部署到生产环境。
典型的第一个项目会从无服务器测试逐步走到成本控制:
firectl quota list,查看账户当前的速率限制、GPU 配额、支出上限和用量。Fireworks 官网首页上的客户引言是厂商挑选的推荐语,并非独立案例研究,但能看出平台面向的工作负载:
有两种情况不太适合。需要固定模型版本的团队从无服务器中获益较少,因为无服务器模型由 Fireworks 团队管理,可能会随新模型发布而更新或弃用。条款禁止未成年人使用,除非有父母或法定监护人监督。
计费采用预付制:自动充值功能可自动为余额充值,月度支出上限可封顶用量。签约客户可能可以改为后付费。
价格单位为美元 / 每 100 万 token,按输入 / 缓存输入 / 输出列出,采集于 2026 年 10 月 5 日。
| 模型 | Standard 层级 | Priority 层级 |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
未单独列出的文本和视觉模型按规模定价:参数少于 4B 为 $0.10,4B 至 16B 为 $0.20,超过 16B 为 $0.90,均为每 1M token,没有单独的缓存价格。批量推理的输入和输出均按无服务器价格的 50% 计费。自 2026 年 9 月 1 日起,已上线的仅限美国模型按基础模型无服务器价格的 1.5 倍定价。
按需部署按 GPU 秒计费,启动时间不额外收费。
| GPU | 每分钟 | 每小时 |
|---|---|---|
| H100 80 GB | $0.134 | $8.00 |
| H200 141 GB | $0.134 | $8.00 |
| B200 180 GB | $0.217 | $13.00 |
| B300 288 GB | $0.250 | $15.00 |
| GB300 288 GB | $0.334 | $20.00 |
区域受限部署按 1.5 倍溢价定价,并需通过销售办理。
托管的监督微调与偏好微调按每 1M 训练 token 定价:
| 基础模型规模 | LoRA SFT | LoRA DPO | 全参数 SFT | 全参数 DPO |
|---|---|---|---|---|
| 最高 16B | $0.50 | $1.00 | $1.00 | $2.00 |
| 16.1B 至 80B | $3.00 | $6.00 | $6.00 | $12.00 |
| 80B 至 300B | $6.00 | $12.00 | $12.00 | $24.00 |
| 超过 300B | $10.00 | $20.00 | $20.00 | $40.00 |
训练 token 估算为训练数据集的 token 数乘以 epoch 数。Dedicated Training API 任务按 GPU 小时、以按需费率计价。
服务成本在不同页面上的说法不同。价格页称微调模型可以按与基础模型相同的价格提供服务,而计费 FAQ 则称训练好的 LoRA 模型需要专属部署才能提供服务,按 GPU 秒计费。
Fireworks 的专属 GPU 按秒计费,而 Baseten 按分钟计量,这一差异对短时、突发型部署影响最大。
默认情况下,未经用户明确选择加入,Fireworks 不会记录或存储任何开源模型的提示词或生成数据;但它会记录 token 数等请求元数据。启用提示词缓存时,部分提示词数据可能在易失性内存中保留数分钟。
Response API 是例外:它默认存储对话,已存储的对话数据会在 30 天后自动删除。条款还把零数据保留承诺限定在推理范围内,不涵盖训练、微调或智能体功能等按设计会保留数据的功能。
关于训练用途,两份文件的措辞不同。服务条款称 Fireworks 不会使用你的内容训练其自有模型或改进服务。隐私声明称,未经你明确选择加入,Fireworks 不会使用提示词、训练数据或 API 输入来训练或改进其模型。就双方而言,你拥有内容的全部权利、所有权和利益,条款将内容定义为你的输入和输出。
企业版管理员可以开启账户级零数据保留策略,该策略会拒绝任何会持久保存客户内容的操作,包括批量推理任务、微调与 RL 任务、数据集上传和 FireRouter 虚拟模型。FireRouter 把某一轮次发给 Claude 或 GPT 时,闭源模型在你自己的 Anthropic 或 OpenAI 账户上运行。
以下为厂商声明,并非独立审计:
在核查过的价格页面上没有出现免费方案。除计费 FAQ 提到的 $1 额度外,持续使用需要付款方式和预付额度。
不能。LoRA 模型需要按 GPU 时间计费的按需部署;一个部署最多可托管 100 个 LoRA 适配器,从而分摊这笔成本。
无服务器推理价格按每个 token 计费,因此空闲时间不产生费用。按需部署被描述为在高利用率下更便宜;它们按 GPU 秒计费,而不是按 token。