Toolso.AI
Toolso.AI
すべてのツールカテゴリ急上昇最新ツール料金プランブログ
Toolso.AI
Toolso.AI

💌AIツールウィークリーを購読

最新かつ最も注目されるAIツールとトレンドの週次厳選セレクションをメールボックスにお届けします 購読

Toolso.AI
Toolso.AI

生産性を向上させる最高のAIツールを発見する

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

人気カテゴリ

  • AI執筆
  • AI画像
  • AI動画
  • AIコーディング
  • 他のカテゴリ

探索

  • 最新ツール
  • 人気ツール
  • 他のツール
  • ツールを提出
  • 料金

会社概要

  • 会社概要
  • お問い合わせ
  • ブログ
  • 変更履歴

法的情報

  • クッキーポリシー
  • プライバシーポリシー
  • 利用規約
  • 返金ポリシー
© 2026 Toolso.AI 無断転載を禁じます
期間限定期間限定注目掲載24時間優先審査・被リンク不要・30日間注目表示$29.90終了後 $59.9010月31日以降 $59.90に値上げ終了まで--:--:--今すぐ投稿
  1. ホーム
  2. すべてのツール
  3. 開発ツール
  4. Fireworks
Fireworksのインターフェースプレビュー
Fireworksのロゴ

Fireworks

Fireworksは、トークン課金のサーバーレスAPIとGPU秒課金の専用デプロイでオープンモデルを提供し、マネージドのファインチューニングも備えて、開発チームが独自のモデルバリアントを学習・ホストできるようにします。

開発ツールAI開発AIトレーニングプラットフォーム#バッチ処理#LLM#OpenAI 互換 API
無料で試す
保存
アクセス数
閲覧数
価格
無料
公開日
2026年10月5日
ドメイン
fireworks.ai
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

Fireworks 製品情報

無料で試す
ツール情報
保存
アクセス数
閲覧数
価格
無料
公開日
2026年10月5日
ドメイン
fireworks.ai
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

注目のツール

関連ツール

無料で試す

Fireworksとは?

Fireworks(ドキュメントではFireworks AIと表記)は、オープンなAIモデルを実行・学習するクラウドプラットフォームです。開発者はLLM推論APIでホスト型モデルを呼び出したり、自社のデプロイ用に専用GPUを借りたり、自社データでオープンモデルをファインチューニングし、その成果を同じインフラ上で提供したりできます。

ベンダーは本プラットフォームを「特化型インテリジェンスのための基盤インフラ」と位置づけ、主要なオープンソースモデルと顧客データを、反復のたびに磨かれる優位性へと変える、顧客自身が所有する学習ループだと説明しています。Fireworksは基盤モデルをゼロからは作っていません。共同創業者兼CEOのリン・チャオは、企業が既存モデルを特定のニーズに合わせてファインチューニングするのを支援する事業だと説明しています。チャオ氏は以前、MetaでAIプラットフォーム開発チームを率いていました。

規模としては、独立系テクノロジーメディアが2026年9月、Fireworksが7月に年換算売上高10億ドル到達を発表し、前年の5倍になったと報じています。

主な機能

サーバーレス推論

  • トークン課金での利用:サーバーレスはトークン単位で課金され、PriorityとFastのオプションがあり、APIはOpenAIおよびAnthropic互換とされています。
  • Priorityモード:PriorityティアはStandardトラフィックより優先され、ロードシェディング(503 server overloaded)を受けにくくなります。
  • Fastモード:Fastバリアントは毎秒100以上の生成トークンのスループットを目指し、ドキュメントによればFastバリアントは別モデルではなく、モデル品質も変わりません。
  • モデルカタログ:ドキュメントには、テキスト、ビジョン、音声、画像、埋め込みの対応モデルが100以上掲載されています。
  • バッチジョブ:Batch APIは大量のリクエストを非同期で処理します。各ジョブは12、24、48、72時間から選んだ制限時間内で実行され、期限切れになっても完了済みのリクエストは保存されます。

専用デプロイ

  • オンデマンドデプロイ:マルチリージョン対応で、事後学習済みモデルも扱える専用デプロイです。
  • カスタム重み:Hugging Faceなどから自社モデル(対応アーキテクチャに限る)をアップロードできます。
  • 予約容量:エンタープライズアカウントは予約容量を購入でき(通常1年契約)、保証された容量、より高いクォータ、より低いGPU時間単価が得られます。
  • 1つのデプロイに多数のアダプター:Multi-LoRAデプロイは、1つのベースモデルデプロイ上に最大100個のLoRAモデルをアドオンとして読み込みます。

学習とファインチューニング

  • 3つの入口:ガイド付きの経路(タスクを説明し、計画とコストを確認して実行を承認)、Fireworksがスケジューリングと本番への引き渡しを担う設定主導の経路、FireworksのGPU上で損失関数、トレーナー、RLループを自分で書くコードの経路があります。
  • 規模:教師ありと強化のファインチューニングは、最大1T+パラメータのモデルまで提供されます。
  • Serverless Training API:ローンチ対象モデルでのLoRA学習向けの、共有で常時稼働のトレーナープールで、プロビジョニング不要、アイドルコストもかかりません。

これらにより、オープンモデルのファインチューニングは独立した製品ではなく、提供までつながるパイプラインになります。ホームページは、すべてのチェックポイントが数秒で本番環境にデプロイされるとしています。

NexusとFireRouter

  • Nexus:オープンモデルとモデルルーターをコーディングハーネス、エージェント、LLMゲートウェイに導入し、対応サーバーレスモデルについて利用状況の可視化とユーザー単位の支出上限を提供します。
  • FireRouter:1つのモデルIDだけを公開し、新しいユーザーターンごとにモデルを選ぶため、簡単なターンはFireworksのオープンモデルへ、難しいターンはClaude Opusなどのクローズドモデルへ振り分けられます。
  • 支出削減の主張:FireworksはNexusを、AIコーディングの支出を50~75%削減できるクローズドモデルAPIのドロップイン代替として売り込んでいます(ベンダーの数字)。

ガイド

典型的な最初のプロジェクトは、サーバーレスでのテストからコスト管理へと進みます。

  1. 有効な支払い方法と請求先住所を追加してからクレジットを購入します。サーバーレス、オンデマンドデプロイ、学習の利用分はすべてこの残高から差し引かれます。
  2. OpenAI Pythonクライアントライブラリを使い、ベースURLとAPIキーを変更してFireworksとやり取りします。
  3. ピーク時も落とせないトラフィックでは、リクエストのサービスティアをPriorityに設定します。レイテンシが重要な機能では、FastバリアントがあればモデルIDをそちらに切り替えます。
  4. 月間支出上限を設定します。デフォルトでは、利用額が上限の80%に達するとFireworksが警告メールを送り、請求ページでアラートのしきい値を追加できます。
  5. ローンチを計画する前にfirectl quota listを実行し、アカウントの現在のレート制限、GPUクォータ、支出上限、利用状況を確認します。
  6. 学習済みLoRAモデル、カスタムモデル、固定バージョンが必要なら、サーバーレスに頼らずオンデマンドデプロイを作成します。

Fireworksのユースケースと顧客事例

Fireworksのホームページの顧客の声は、独立したケーススタディではなくベンダーが選んだ推薦コメントですが、プラットフォームが狙うワークロードがわかります。

  • AIコーディング製品:Cursorの最高製品責任者は、高スループットのRLワークロードやComposerの本番推論を含め、Cursorを支えるモデルを大規模に学習・提供するうえでFireworksが重要なパートナーだったと述べています。
  • より高速なコンシューマーアプリ:Quoraのプロダクトリードは、1つのモデルの移行後に応答時間が3倍速くなったと報告し、同社はこれでエンゲージメント指標が向上したとしています。
  • ファインチューニングした複合モデル:VercelのCTOは、同社のv0モデルがFireworksでファインチューニングした強化学習モデルを使い、SOTAを大きく上回る性能だと述べています。
  • Azure経由のエンタープライズエージェント:UiPathはAzure Foundry上でFireworksを動かし、オープンモデルでAutopilotとDelegateを支えています。
  • クローズドモデルからオープンモデルへの切り替え:Gumloopは社内全体で使うエージェントをOpus 4.8からGLM-5.2に移行し、体験の違いに誰も気づかなかったと報告しています。

対象ユーザー

  • プロトタイピング中のチーム:人気モデルをトークン課金でサーバーレス利用する形は、感覚で品質を確かめるバイブテストやプロトタイピングに最適と位置づけられています。
  • 自社モデルや学習済みモデルを運用するチーム:オンデマンドは、カスタムベースモデル、学習済みLoRAモデル、ハードウェアやレプリカの制御が必要な独自のレイテンシ要件を持つワークロードに向いています。
  • 規制対象の企業:アカウント全体のデータ非保持ポリシーとリージョン固定の推論は、セルフサービスの設定ではなくエンタープライズ機能です。

2つのケースでは適合度が下がります。固定のモデルバージョンが必要なチームは、サーバーレスの恩恵が小さくなります。サーバーレスモデルはFireworksチームが管理し、新モデルのリリースに伴い更新または非推奨になる可能性があるためです。規約上、未成年者の利用は、親または法定後見人の監督がない限り禁止されています。

プラットフォーム

  • API:OpenAIおよびAnthropic互換のエンドポイントがあり、既存のSDKコードの接続先をFireworksに向けられます。
  • CLI:firectlはターミナルからリソースの作成、デプロイ、管理を行い、Homebrewでインストールできます。
  • Microsoft Foundry:Fireworks AIはMicrosoft Foundry内のファーストパーティ推論プロバイダーで、利用料はAzure経由で請求され、Azureの消費コミットメントに計上されます。
  • Foundry PayGoの範囲:Foundry上のPayGoはUS Data Zoneに限られ、PayGoデプロイのスループット上限は毎分500,000トークンです。
  • リージョン:専用デプロイはGLOBAL、US、CANADA、EUROPE、APACのマルチリージョンを対象にできます。
  • 米国限定のサーバーレス:別の米国エンドポイントが、少数のモデルについて米国内のみで推論を提供します。EU限定のサーバーレスは営業への問い合わせが必要です。

価格

課金は前払い制です。自動チャージで残高を自動補充でき、月間支出上限で利用額に上限を設けられます。契約顧客は後払いに切り替えられる場合があります。

サーバーレス推論の料金

価格は100万トークンあたりの米ドルで、入力 / キャッシュ入力 / 出力の順に示し、2026年10月5日時点の取得です。

モデルStandardPriority
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

個別掲載のないテキスト・ビジョンモデルはサイズ別料金です。4Bパラメータ未満は$0.10、4B~16Bは$0.20、16B超は$0.90(いずれも1Mトークンあたり)で、キャッシュ料金の区別はありません。バッチ推論は入力・出力ともサーバーレス料金の50%で課金されます。2026年9月1日以降、提供開始済みの米国限定モデルは、ベースモデルのサーバーレス料金の1.5倍です。

オンデマンドGPUの料金

オンデマンドデプロイはGPU秒単位で課金され、起動時間に追加料金はかかりません。

GPU1分あたり1時間あたり
H100 80 GB$0.134$8.00
H200 141 GB$0.134$8.00
B200 180 GB$0.217$13.00
B300 288 GB$0.250$15.00
GB300 288 GB$0.334$20.00

リージョン制限付きデプロイは1.5倍の割増料金で、営業経由となります。

ファインチューニングの料金

マネージドの教師あり・選好ファインチューニングは、学習トークン1Mあたりの課金です。

ベースモデルのサイズLoRA SFTLoRA DPOフルパラメータSFTフルパラメータDPO
16B以下$0.50$1.00$1.00$2.00
16.1B~80B$3.00$6.00$6.00$12.00
80B~300B$6.00$12.00$12.00$24.00
300B超$10.00$20.00$20.00$40.00

学習トークン数は、学習データセットのトークン数にエポック数を掛けて見積もられます。Dedicated Training APIのジョブは、オンデマンド料金に基づきGPU時間単位で課金されます。

提供コストの読み方はページで異なります。料金ページはファインチューニング済みモデルをベースモデルと同じ価格で提供できるとしている一方、課金FAQは学習済みLoRAモデルの提供には専用デプロイが必要で、GPU秒単位で課金されるとしています。

クレジット、ティア、返金

  • 初期クレジット:課金FAQは$1のクレジットに言及しています。使い切ると、支払い方法のないアカウントは支払い方法を追加するまで停止されます。
  • 支出ティア:クレジットを$50追加または消費するとTier 2、$500でTier 3、$5,000でTier 4に上がり、上位ティアほどサーバーレスのレート制限の上限が上がります。
  • ボリューム価格:Fireworksは大量購入や前払い購入に割引を設けています。
  • 返金:利用規約は、規約に定める場合を除き、支払い済みの料金は返金不可としています。

Fireworksの代替サービス

  • Together AI:料金体系はサーバーレス推論、プロビジョンドスループット、シングルテナントGPUでの専用推論、LoRAまたはフルファインチューニングにわたり、Fireworksが販売する製品構成と同じ区分です。
  • Baseten:Model APIsと専用デプロイを組み合わせ、専用デプロイでは使った計算資源の分だけを分単位で支払います。Basicプランは月額$0の従量課金です。

Fireworksは専用GPUを秒単位で課金する一方、Basetenは分単位で計測し、この違いは短時間でバースト的なデプロイで最も効いてきます。

制限事項

レート制限とキャパシティ

  • 新規アカウントのスロットリング:支払い方法またはクレジットのないアカウントは毎分10リクエストに制限され、支払い方法とクレジットがあってもアカウント全体の上限は毎分6,000リクエストです。
  • 適応型のサーバーレス制限:制限は利用状況に応じて増減し、トラフィックの増加が急すぎると429が返されます。
  • 成功の保証なし:サーバーレスでは429 Too Many Requestsや503 Service Overloadedが返されることがあり、制限内に収めてもロードシェディングは防げません。
  • モデルサイズ別の上限:生成トークンの上限は、600Bパラメータ未満のモデルの毎分1.08Mトークンから、1.6Tパラメータ以上のモデルの216kまで幅があります。
  • GPUクォータ:GLOBALマルチリージョンのデフォルトのオンデマンドクォータは、H100、H200、B200、B300が各16 GPUで、GB300とA100は0から始まります。
  • 学習クォータにはカードが必要:支払い方法がなければ学習用GPUクォータは0、登録済みなら種類ごとに32 GPUです。

運用上の境界

  • モデルの削除:Fireworksはサーバーレスモデルを削除する少なくとも2週間前に事前通知し、人気モデルではより長い通知期間を設けます。
  • アイドル状態のデプロイ:デフォルトでは、デプロイは1時間使われないとゼロまでスケールダウンし、最小レプリカ数を0に設定したデプロイはトラフィックがないまま7日たつと削除されます。
  • プリエンプティブル容量:プリエンプティブルデプロイはアイドルGPUを借りて使い、リクエストの途中で警告なくプリエンプトされることがあるため、評価とバッチ処理専用とされています。
  • 支出のハードストップ:利用額が月間支出上限の100%に達すると、サーバーレス推論、デプロイ、学習のすべてのAPIリクエストが一時停止します(エンタープライズアカウントはアラートのみ)。
  • 支出レポートの遅延:総支出の数値は実際のトラフィックより1日以上遅れることがあり、新規リリースのモデルでは特にそうです。
  • PCI非準拠:規約によれば、FireworksはPCIに準拠しておらず、準拠を達成する義務もありません。

データ保持と学習への利用

デフォルトでは、Fireworksはユーザーの明示的なオプトインがない限り、どのオープンモデルについてもプロンプトや生成データを記録・保存しません。ただし、トークン数などのリクエストメタデータは記録します。プロンプトキャッシュ有効時は、一部のプロンプトデータが揮発性メモリに数分間残ることがあります。

Response APIは例外で、デフォルトで会話を保存し、保存された会話は30日後に自動削除されます。規約はさらに、データ非保持の約束を推論に限定しており、学習、ファインチューニング、エージェント機能など、設計上データを保持する機能は対象外です。

学習への利用については、2つの文書で表現が異なります。利用規約は、Fireworksがユーザーのコンテンツを自社モデルの学習やサービス改善に使用しないとしています。プライバシー通知は、明示的なオプトインがない限り、プロンプト、学習データ、API入力をモデルの学習や改善に使用しないとしています。当事者間では、ユーザーはコンテンツに関するすべての権利、権原、利益を有し、規約はコンテンツをユーザーの入力と出力と定義しています。

エンタープライズの管理者は、アカウント全体のデータ非保持ポリシーを有効にできます。このポリシーは、バッチ推論ジョブ、ファインチューニングやRLのジョブ、データセットのアップロード、FireRouterの仮想モデルなど、顧客コンテンツを永続化するものをすべて拒否します。FireRouterがターンをClaudeやGPTに送ると、そのクローズドモデルはユーザー自身のAnthropicまたはOpenAIアカウントで実行されます。

セキュリティとコンプライアンスに関する表明

以下はベンダーの表明で、独立した監査ではありません。

  • Fireworksは、ISO 27001、ISO 27701、ISO 42001の認証を取得し、SOC 2 Type IIを保持しているとしています。
  • FireworksはHIPAA準拠を自称しています。
  • データは転送中はTLS 1.2+、保存時はAES-256で暗号化されます。
  • 推論を1つのリージョンに限定するデータレジデンシーはエンタープライズ機能で、掲載の選択肢はUSです。

よくある質問

Q1. 無料枠はありますか?

確認した料金ページには無料プランは見当たりません。課金FAQにある$1のクレジット以外に、継続して使うには支払い方法と前払いクレジットが必要です。

Q2. ファインチューニングしたLoRAモデルをサーバーレスで提供できますか?

できません。LoRAモデルにはGPU時間で課金されるオンデマンドデプロイが必要です。1つのデプロイで最大100個のLoRAアダプターをホストでき、そのコストを分散できます。

Q3. 専用GPUがサーバーレスより安くなるのはどんなときですか?

サーバーレス推論の料金はトークンごとに課金されるため、アイドル時間にはコストがかかりません。オンデマンドデプロイは高利用率では安くなると説明されており、トークン単位ではなくGPU秒単位で課金されます。

類似のツールをご存知ですか?
他の素晴らしいAIツールをご存知でしたら、ぜひ私たちに提出してください