Fireworks(ドキュメントではFireworks AIと表記)は、オープンなAIモデルを実行・学習するクラウドプラットフォームです。開発者はLLM推論APIでホスト型モデルを呼び出したり、自社のデプロイ用に専用GPUを借りたり、自社データでオープンモデルをファインチューニングし、その成果を同じインフラ上で提供したりできます。
ベンダーは本プラットフォームを「特化型インテリジェンスのための基盤インフラ」と位置づけ、主要なオープンソースモデルと顧客データを、反復のたびに磨かれる優位性へと変える、顧客自身が所有する学習ループだと説明しています。Fireworksは基盤モデルをゼロからは作っていません。共同創業者兼CEOのリン・チャオは、企業が既存モデルを特定のニーズに合わせてファインチューニングするのを支援する事業だと説明しています。チャオ氏は以前、MetaでAIプラットフォーム開発チームを率いていました。
規模としては、独立系テクノロジーメディアが2026年9月、Fireworksが7月に年換算売上高10億ドル到達を発表し、前年の5倍になったと報じています。
これらにより、オープンモデルのファインチューニングは独立した製品ではなく、提供までつながるパイプラインになります。ホームページは、すべてのチェックポイントが数秒で本番環境にデプロイされるとしています。
典型的な最初のプロジェクトは、サーバーレスでのテストからコスト管理へと進みます。
firectl quota listを実行し、アカウントの現在のレート制限、GPUクォータ、支出上限、利用状況を確認します。Fireworksのホームページの顧客の声は、独立したケーススタディではなくベンダーが選んだ推薦コメントですが、プラットフォームが狙うワークロードがわかります。
2つのケースでは適合度が下がります。固定のモデルバージョンが必要なチームは、サーバーレスの恩恵が小さくなります。サーバーレスモデルはFireworksチームが管理し、新モデルのリリースに伴い更新または非推奨になる可能性があるためです。規約上、未成年者の利用は、親または法定後見人の監督がない限り禁止されています。
課金は前払い制です。自動チャージで残高を自動補充でき、月間支出上限で利用額に上限を設けられます。契約顧客は後払いに切り替えられる場合があります。
価格は100万トークンあたりの米ドルで、入力 / キャッシュ入力 / 出力の順に示し、2026年10月5日時点の取得です。
| モデル | Standard | Priority |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
個別掲載のないテキスト・ビジョンモデルはサイズ別料金です。4Bパラメータ未満は$0.10、4B~16Bは$0.20、16B超は$0.90(いずれも1Mトークンあたり)で、キャッシュ料金の区別はありません。バッチ推論は入力・出力ともサーバーレス料金の50%で課金されます。2026年9月1日以降、提供開始済みの米国限定モデルは、ベースモデルのサーバーレス料金の1.5倍です。
オンデマンドデプロイはGPU秒単位で課金され、起動時間に追加料金はかかりません。
| GPU | 1分あたり | 1時間あたり |
|---|---|---|
| H100 80 GB | $0.134 | $8.00 |
| H200 141 GB | $0.134 | $8.00 |
| B200 180 GB | $0.217 | $13.00 |
| B300 288 GB | $0.250 | $15.00 |
| GB300 288 GB | $0.334 | $20.00 |
リージョン制限付きデプロイは1.5倍の割増料金で、営業経由となります。
マネージドの教師あり・選好ファインチューニングは、学習トークン1Mあたりの課金です。
| ベースモデルのサイズ | LoRA SFT | LoRA DPO | フルパラメータSFT | フルパラメータDPO |
|---|---|---|---|---|
| 16B以下 | $0.50 | $1.00 | $1.00 | $2.00 |
| 16.1B~80B | $3.00 | $6.00 | $6.00 | $12.00 |
| 80B~300B | $6.00 | $12.00 | $12.00 | $24.00 |
| 300B超 | $10.00 | $20.00 | $20.00 | $40.00 |
学習トークン数は、学習データセットのトークン数にエポック数を掛けて見積もられます。Dedicated Training APIのジョブは、オンデマンド料金に基づきGPU時間単位で課金されます。
提供コストの読み方はページで異なります。料金ページはファインチューニング済みモデルをベースモデルと同じ価格で提供できるとしている一方、課金FAQは学習済みLoRAモデルの提供には専用デプロイが必要で、GPU秒単位で課金されるとしています。
Fireworksは専用GPUを秒単位で課金する一方、Basetenは分単位で計測し、この違いは短時間でバースト的なデプロイで最も効いてきます。
デフォルトでは、Fireworksはユーザーの明示的なオプトインがない限り、どのオープンモデルについてもプロンプトや生成データを記録・保存しません。ただし、トークン数などのリクエストメタデータは記録します。プロンプトキャッシュ有効時は、一部のプロンプトデータが揮発性メモリに数分間残ることがあります。
Response APIは例外で、デフォルトで会話を保存し、保存された会話は30日後に自動削除されます。規約はさらに、データ非保持の約束を推論に限定しており、学習、ファインチューニング、エージェント機能など、設計上データを保持する機能は対象外です。
学習への利用については、2つの文書で表現が異なります。利用規約は、Fireworksがユーザーのコンテンツを自社モデルの学習やサービス改善に使用しないとしています。プライバシー通知は、明示的なオプトインがない限り、プロンプト、学習データ、API入力をモデルの学習や改善に使用しないとしています。当事者間では、ユーザーはコンテンツに関するすべての権利、権原、利益を有し、規約はコンテンツをユーザーの入力と出力と定義しています。
エンタープライズの管理者は、アカウント全体のデータ非保持ポリシーを有効にできます。このポリシーは、バッチ推論ジョブ、ファインチューニングやRLのジョブ、データセットのアップロード、FireRouterの仮想モデルなど、顧客コンテンツを永続化するものをすべて拒否します。FireRouterがターンをClaudeやGPTに送ると、そのクローズドモデルはユーザー自身のAnthropicまたはOpenAIアカウントで実行されます。
以下はベンダーの表明で、独立した監査ではありません。
確認した料金ページには無料プランは見当たりません。課金FAQにある$1のクレジット以外に、継続して使うには支払い方法と前払いクレジットが必要です。
できません。LoRAモデルにはGPU時間で課金されるオンデマンドデプロイが必要です。1つのデプロイで最大100個のLoRAアダプターをホストでき、そのコストを分散できます。
サーバーレス推論の料金はトークンごとに課金されるため、アイドル時間にはコストがかかりません。オンデマンドデプロイは高利用率では安くなると説明されており、トークン単位ではなくGPU秒単位で課金されます。