Toolso.AI
Toolso.AI
所有工具分类热门榜单最新工具价格博客
Toolso.AI
Toolso.AI

💌订阅 AI 工具周报

每周精选最新、最热门的AI工具和行业动态,直达您的邮箱 订阅

Toolso.AI
Toolso.AI

发现最好的AI工具,提升你的工作效率

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

热门分类

  • AI写作
  • AI图像
  • AI视频
  • AI编程
  • 更多分类

探索发现

  • 最新收录
  • 热门推荐
  • 更多工具
  • 提交工具
  • 价格

关于

  • 关于我们
  • 联系我们
  • 博客
  • 更新日志

法律

  • Cookie政策
  • 隐私政策
  • 服务条款
  • 退款政策
© 2026 Toolso.AI 保留所有权利
限时推广限时推广加速推广24h 优先审核 · 无需反链 · 30 天推荐展示$29.90到期后 $59.9010月31日后涨价至 $59.90距结束--:--:--立即提交
  1. 首页
  2. 所有工具
  3. 开发工具
  4. Fireworks
Fireworks界面预览
Fireworks标志

Fireworks

Fireworks 通过按 token 计费的无服务器 API 和按 GPU 秒计费的专属部署提供开源模型服务,并提供托管微调,便于开发团队训练和托管自己的模型变体。

开发工具AI开发AI训练平台#批量处理#大语言模型#OpenAI 兼容 API
免费试用
收藏
访问次数
浏览次数
定价
免费
发布日期
2026年10月5日
域名
fireworks.ai
用户评分

用过这个工具吗?给它评分

为这个工具评分

Fireworks 工具信息

免费试用
工具信息
收藏
访问次数
浏览次数
定价
免费
发布日期
2026年10月5日
域名
fireworks.ai
用户评分

用过这个工具吗?给它评分

为这个工具评分

推荐工具

相关工具推荐

免费试用

Fireworks 是什么?

Fireworks(其文档中写作 Fireworks AI)是一个运行和训练开源 AI 模型的云平台。开发者可以通过 LLM 推理 API 调用托管模型,为自己的部署租用专属 GPU,或用自有数据微调开源模型,并在同一套基础设施上用成果提供服务。

厂商把平台定位为“面向专业化智能的基础设施”,即一个归客户所有的学习闭环,把领先的开源模型与客户数据转化为随每次迭代不断强化的优势。Fireworks 并不从零构建基础模型:联合创始人兼 CEO Lin Qiao 曾表示,公司的业务是帮助企业针对特定需求微调现有模型。Lin Qiao 此前在 Meta 领导 AI 平台开发团队。

就规模而言,独立科技媒体在 2026 年 9 月报道称,Fireworks 于 7 月宣布其年化收入已达 10 亿美元,是前一年的五倍。

核心功能

无服务器推理

  • 按 token 付费:无服务器推理按 token 计费,提供 Priority 和 Fast 选项,API 被描述为兼容 OpenAI 和 Anthropic。
  • Priority 模式:Priority 层级的优先级高于 Standard 流量,被负载削减(503 server overloaded)的可能性更低。
  • Fast 模式:Fast 变体的目标是每秒生成 100+ token 的吞吐量;文档说明 Fast 变体不是另一个模型,模型质量保持不变。
  • 模型目录:文档列出 100+ 个受支持的模型,覆盖文本、视觉、音频、图像和嵌入。
  • 批处理任务:Batch API 异步处理大量请求;每个任务按所选的 12、24、48 或 72 小时时限运行,任务过期时已完成的请求会被保存。

专属部署

  • 按需部署:支持多区域、也支持后训练模型的专属部署。
  • 自定义权重:可以从 Hugging Face 或其他来源上传自己的模型(限受支持的架构)。
  • 预留容量:企业版账户可购买预留容量,通常需承诺 1 年,以获得有保障的容量、更高的配额和更低的 GPU 小时价格。
  • 单个部署挂载多个适配器:Multi-LoRA 部署可在单个基础模型部署上以附加形式加载最多 100 个 LoRA 模型。

训练与微调

  • 三种入口:引导式路径(描述任务、审阅方案与成本、批准运行);配置驱动路径,由 Fireworks 负责调度和交付生产;代码路径,你在 Fireworks 的 GPU 上自己编写损失函数、训练器和 RL 循环。
  • 规模:监督微调和强化微调面向参数量最高 1T+ 的模型提供。
  • Serverless Training API:共享、始终在线的训练器池,用于在首批支持的模型上做 LoRA 训练,无需预配资源,也没有闲置成本。

这些选项让开源模型微调成为通往部署服务的流水线,而不是独立产品:官网首页称每个检查点都能在几秒内部署到生产环境。

Nexus 与 FireRouter

  • Nexus:把开源模型和模型路由器接入编程智能体运行框架、智能体和 LLM 网关,并为受支持的无服务器模型提供用量可见性和按用户设置的支出上限。
  • FireRouter:对外只暴露一个模型 ID,并为每个新的用户轮次挑选模型,简单轮次可交给 Fireworks 的开源模型,较难的轮次可交给 Claude Opus 等闭源模型。
  • 支出说法:Fireworks 将 Nexus 宣传为闭源模型 API 的即插即用替代品,可将 AI 编程支出降低 50% 至 75%,这是厂商给出的数字。

使用指南

典型的第一个项目会从无服务器测试逐步走到成本控制:

  1. 添加有效的付款方式和账单地址,然后购买额度;无服务器、按需部署和训练的用量都从该余额中扣除。
  2. 使用 OpenAI Python 客户端库,修改 base URL 和 API 密钥即可与 Fireworks 交互。
  3. 对必须扛过高峰期的流量,把请求的服务层级设为 Priority;对延迟敏感的功能,在有 Fast 变体时把模型 ID 切换为 Fast 变体。
  4. 设置月度支出上限。默认情况下,用量达到月度支出上限的 80% 时 Fireworks 会发送警告邮件,还可以在账单页面添加更多提醒阈值。
  5. 在规划上线前运行 firectl quota list,查看账户当前的速率限制、GPU 配额、支出上限和用量。
  6. 需要训练好的 LoRA 模型、自定义模型或固定版本时,创建按需部署,而不是依赖无服务器。

Fireworks 的使用场景与客户案例

Fireworks 官网首页上的客户引言是厂商挑选的推荐语,并非独立案例研究,但能看出平台面向的工作负载:

  • AI 编程产品:Cursor 的首席产品官表示,Fireworks 一直是帮助其大规模训练和运行 Cursor 背后模型的关键合作伙伴,包括高吞吐量的 RL 工作负载和 Composer 的生产推理。
  • 更快的消费级应用:一位 Quora 产品负责人称,迁移一个模型后响应时间提速 3 倍,公司表示这提升了用户参与度指标。
  • 微调后的复合模型:Vercel 的 CTO 表示,其 v0 模型借助 Fireworks 使用了经过微调的强化学习模型,表现明显优于 SOTA。
  • 通过 Azure 运行的企业智能体:UiPath 在 Azure Foundry 上运行 Fireworks,用开源模型驱动 Autopilot 和 Delegate。
  • 以开源模型替换闭源模型:Gumloop 将公司内部一个全员使用的智能体从 Opus 4.8 换成 GLM-5.2,并称没有人察觉到体验上的差异。

适用人群

  • 原型开发团队:以按 token 计费的方式在无服务器上使用热门模型,被定位为非常适合凭感觉的质量测试和原型开发。
  • 运行自有模型或训练后模型的团队:按需部署适合自定义基础模型、训练好的 LoRA 模型,以及有自定义延迟要求、需要掌控硬件和副本的工作负载。
  • 受监管的企业:账户级零数据保留策略和区域锁定推理属于企业版功能,而不是自助设置。

有两种情况不太适合。需要固定模型版本的团队从无服务器中获益较少,因为无服务器模型由 Fireworks 团队管理,可能会随新模型发布而更新或弃用。条款禁止未成年人使用,除非有父母或法定监护人监督。

支持平台

  • API:兼容 OpenAI 和 Anthropic 的端点,现有 SDK 代码可以直接指向 Fireworks。
  • CLI:firectl 可在终端中创建、部署和管理资源,并可通过 Homebrew 安装。
  • Microsoft Foundry:Fireworks AI 是 Microsoft Foundry 中的第一方推理服务商,用量通过 Azure 计费,并计入 Azure 消费承诺。
  • Foundry PayGo 边界:Foundry 上的 PayGo 仅限 US Data Zone,PayGo 部署的吞吐量上限为每分钟 500,000 token。
  • 区域:专属部署可选择 GLOBAL、US、CANADA、EUROPE 和 APAC 多区域。
  • 仅限美国的无服务器:一个独立的美国端点只在美国境内为一小批模型提供推理;仅限欧盟的无服务器需要联系销售。

价格套餐

计费采用预付制:自动充值功能可自动为余额充值,月度支出上限可封顶用量。签约客户可能可以改为后付费。

无服务器推理价格

价格单位为美元 / 每 100 万 token,按输入 / 缓存输入 / 输出列出,采集于 2026 年 10 月 5 日。

模型Standard 层级Priority 层级
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

未单独列出的文本和视觉模型按规模定价:参数少于 4B 为 $0.10,4B 至 16B 为 $0.20,超过 16B 为 $0.90,均为每 1M token,没有单独的缓存价格。批量推理的输入和输出均按无服务器价格的 50% 计费。自 2026 年 9 月 1 日起,已上线的仅限美国模型按基础模型无服务器价格的 1.5 倍定价。

按需 GPU 价格

按需部署按 GPU 秒计费,启动时间不额外收费。

GPU每分钟每小时
H100 80 GB$0.134$8.00
H200 141 GB$0.134$8.00
B200 180 GB$0.217$13.00
B300 288 GB$0.250$15.00
GB300 288 GB$0.334$20.00

区域受限部署按 1.5 倍溢价定价,并需通过销售办理。

微调价格

托管的监督微调与偏好微调按每 1M 训练 token 定价:

基础模型规模LoRA SFTLoRA DPO全参数 SFT全参数 DPO
最高 16B$0.50$1.00$1.00$2.00
16.1B 至 80B$3.00$6.00$6.00$12.00
80B 至 300B$6.00$12.00$12.00$24.00
超过 300B$10.00$20.00$20.00$40.00

训练 token 估算为训练数据集的 token 数乘以 epoch 数。Dedicated Training API 任务按 GPU 小时、以按需费率计价。

服务成本在不同页面上的说法不同。价格页称微调模型可以按与基础模型相同的价格提供服务,而计费 FAQ 则称训练好的 LoRA 模型需要专属部署才能提供服务,按 GPU 秒计费。

额度、等级与退款

  • 起始额度:计费 FAQ 提到 $1 额度;用完后,未绑定付款方式的账户会被暂停,直到添加付款方式为止。
  • 消费等级:充值或消费 $50 额度可将账户升至 Tier 2,$500 升至 Tier 3,$5,000 升至 Tier 4;等级越高,无服务器速率限制的上限越高。
  • 批量价格:Fireworks 为大宗或预付购买提供折扣。
  • 退款:服务条款规定,已支付的费用不予退还,条款另有规定的除外。

Fireworks 的替代方案

  • Together AI:其定价涵盖无服务器推理、预配吞吐量、单租户 GPU 上的专属推理,以及 LoRA 或全量微调,与 Fireworks 销售的产品划分相同。
  • Baseten:它把 Model APIs 与专属部署结合起来,专属部署只需为实际使用的算力付费、精确到分钟,其 Basic 方案为每月 $0,按用量付费。

Fireworks 的专属 GPU 按秒计费,而 Baseten 按分钟计量,这一差异对短时、突发型部署影响最大。

注意事项

速率限制与容量

  • 新账户受限流:没有付款方式或没有额度的账户被限制为每分钟 10 个请求;即使有付款方式和额度,账户整体上限也是每分钟 6,000 个请求。
  • 自适应的无服务器限制:限制会随用量增减,如果流量增长过快,就会收到 429。
  • 不保证成功:在无服务器上可能遇到 429 Too Many Requests 或 503 Service Overloaded 响应,且保持在限制以内也无法避免负载削减。
  • 按模型规模的上限:生成 token 上限从参数少于 600B 的模型每分钟 1.08M token,到 1.6T 及以上参数模型的 216k 不等。
  • GPU 配额:GLOBAL 多区域的默认按需配额为 H100、H200、B200 和 B300 各 16 块 GPU,GB300 和 A100 初始为 0。
  • 训练配额需绑卡:没有付款方式时训练 GPU 配额为 0;绑定付款方式后每种类型 32 块 GPU。

运营边界

  • 模型下线:Fireworks 在移除无服务器模型前至少提前 2 周通知,热门模型的通知期更长。
  • 闲置部署:默认情况下,部署闲置 1 小时会缩容到零;最小副本数设为 0 的部署在 7 天无流量后会被删除。
  • 可抢占容量:可抢占部署借用闲置 GPU,可能在请求进行中被无预警抢占,因此仅适用于评估和批处理工作。
  • 硬性支出停止:用量达到月度支出上限的 100% 时,无服务器推理、部署和训练的所有 API 请求都会暂停(企业版账户只收到提醒)。
  • 支出报告延迟:总支出数据可能比实时流量滞后一天或更久,新上线的模型尤其如此。
  • 不符合 PCI:条款称 Fireworks 不符合 PCI 标准,也没有义务达到 PCI 合规。

数据保留与训练用途

默认情况下,未经用户明确选择加入,Fireworks 不会记录或存储任何开源模型的提示词或生成数据;但它会记录 token 数等请求元数据。启用提示词缓存时,部分提示词数据可能在易失性内存中保留数分钟。

Response API 是例外:它默认存储对话,已存储的对话数据会在 30 天后自动删除。条款还把零数据保留承诺限定在推理范围内,不涵盖训练、微调或智能体功能等按设计会保留数据的功能。

关于训练用途,两份文件的措辞不同。服务条款称 Fireworks 不会使用你的内容训练其自有模型或改进服务。隐私声明称,未经你明确选择加入,Fireworks 不会使用提示词、训练数据或 API 输入来训练或改进其模型。就双方而言,你拥有内容的全部权利、所有权和利益,条款将内容定义为你的输入和输出。

企业版管理员可以开启账户级零数据保留策略,该策略会拒绝任何会持久保存客户内容的操作,包括批量推理任务、微调与 RL 任务、数据集上传和 FireRouter 虚拟模型。FireRouter 把某一轮次发给 Claude 或 GPT 时,闭源模型在你自己的 Anthropic 或 OpenAI 账户上运行。

安全与合规声明

以下为厂商声明,并非独立审计:

  • Fireworks 称已获得 ISO 27001、ISO 27701 和 ISO 42001 认证,并持有 SOC 2 Type II。
  • Fireworks 自称符合 HIPAA。
  • 数据传输中使用 TLS 1.2+ 加密,静态数据使用 AES-256 加密。
  • 将推理限制在单一区域的数据驻留是企业版功能;列出的选项为 US。

FAQ

Q1. 有免费套餐吗?

在核查过的价格页面上没有出现免费方案。除计费 FAQ 提到的 $1 额度外,持续使用需要付款方式和预付额度。

Q2. 微调后的 LoRA 模型能在无服务器上提供服务吗?

不能。LoRA 模型需要按 GPU 时间计费的按需部署;一个部署最多可托管 100 个 LoRA 适配器,从而分摊这笔成本。

Q3. 专属 GPU 什么时候比无服务器更便宜?

无服务器推理价格按每个 token 计费,因此空闲时间不产生费用。按需部署被描述为在高利用率下更便宜;它们按 GPU 秒计费,而不是按 token。

发现类似工具?
如果你知道其他优秀的AI工具,欢迎提交给我们