Toolso.AI
Toolso.AI
すべてのツールカテゴリ急上昇最新ツール料金プランブログ
Toolso.AI
Toolso.AI

💌AIツールウィークリーを購読

最新かつ最も注目されるAIツールとトレンドの週次厳選セレクションをメールボックスにお届けします 購読

Toolso.AI
Toolso.AI

生産性を向上させる最高のAIツールを発見する

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

人気カテゴリ

  • AI執筆
  • AI画像
  • AI動画
  • AIコーディング
  • 他のカテゴリ

探索

  • 最新ツール
  • 人気ツール
  • 他のツール
  • ツールを提出
  • 料金

会社概要

  • 会社概要
  • お問い合わせ
  • ブログ
  • 変更履歴

法的情報

  • クッキーポリシー
  • プライバシーポリシー
  • 利用規約
  • 返金ポリシー
© 2026 Toolso.AI 無断転載を禁じます
期間限定期間限定注目掲載24時間優先審査・被リンク不要・30日間注目表示$29.90終了後 $59.9010月31日以降 $59.90に値上げ終了まで--:--:--今すぐ投稿
  1. ホーム
  2. すべてのツール
  3. 開発ツール
  4. Cerebras
Cerebrasのインターフェースプレビュー
Cerebrasのロゴ

Cerebras

Cerebrasは自社のウェハースケールプロセッサでGPT OSS 120BやQwen 3.8 27Bなどのオープンウェイトモデルを動かし、OpenAI互換APIで提供する。従量課金のトークン、予約型のDedicated容量、オンプレミスのCS-4システムを用意している。

開発ツールAI開発AIトレーニングプラットフォーム#エンタープライズ#LLM#OpenAI 互換 API
価格を見る
保存
アクセス数
閲覧数
価格
有料
公開日
2026年10月4日
ドメイン
cerebras.ai
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

Cerebras 製品情報

価格を見る
ツール情報
保存
アクセス数
閲覧数
価格
有料
公開日
2026年10月4日
ドメイン
cerebras.ai
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

注目のツール

関連ツール

価格を見る

Cerebrasとは?

Cerebrasは、自社開発のウェハースケールプロセッサ上でオープンウェイトの言語モデルを動かすAI推論プラットフォームである。開発者はブラウザのPlaygroundを備えたクラウドAPI、Cerebras Inferenceから利用する。大規模な組織はDedicatedの専用容量を予約したり、自社データセンターにCerebrasシステムを設置したりでき、同じハードウェアが学習とファインチューニングのサービスも支えている。

パブリッククラウド層では、定期的に更新されるモデルのラインナップを共有エンドポイントで提供し、APIキーで呼び出す。

最大の売りは速度だ。Cerebrasは最新のラック規模システムCS-4について、GPUより最大30倍高速な推論を実現するとしているが、これは独立した測定ではなくベンダーの数値である。

製品を手がけるCerebras Systemsは2026年5月のIPOで55億ドルを調達した。独立系のビジネス報道は、OpenAI、G42、Mohamed bin Zayed University of Artificial Intelligence、Amazon Web Servicesを顧客として挙げている。

主な機能

Shared Inference(共有推論API)

  • OpenAI互換API:Cerebras APIは多くの一般的なワークフローでOpenAIのクライアントライブラリと組み合わせて使えるため、既存アプリはAPIキー、base URL、対象モデルを変えるだけで切り替えられる。
  • 小規模なセルフサーブカタログ:Shared Inferenceに現在掲載されているのは、gpt-oss-120b(パラメータ1,200億、コンテキストは無料トライアルで65k・有料プランで131k、毎秒約3,000トークン)とqwen-3.8-27b(パラメータ270億、コンテキスト64k/128k、毎秒約1,850トークン)である。
  • 契約で広がるカタログ:その他のモデルファミリーはDedicated Inferenceでのみ提供される。
  • 画像入力:Shared Inferenceではqwen-3.8-27bが画像入力に対応し、gemma-4-31bなど画像を扱える他のモデルにはDedicated Inferenceが必要となる。
  • 推論強度の制御:qwen-3.8-27bでは推論強度をnone、low、medium、highから選べ、デフォルトはhighで、推論内容は回答とは別に返される。

モデルの忠実性は珍しいほど詳しく文書化されている。Cerebrasは、Shared Inferenceの全モデルが枝刈りされていないオリジナル版だと明言している。重みは選択的な重みのみの量子化により一部16、8または4ビット形式で保存され、敏感な層はフル精度のまま、活性化・アテンション・KVキャッシュは量子化されない。高速AI推論のプロバイダーを比較する人にとって、速度の数字の裏で実際に何が提供されているかがわかる情報だ。

プロンプトキャッシュ

プロンプトキャッシュは対応するすべてのAPIリクエストで自動的に働き、キャッシュブレークポイントの設定やコード変更は要らない。CerebrasはキャッシュのTTLとして5分を保証し、システム負荷によってはエントリが最大1時間残ることもある。利点は価格ではなく容量にある。キャッシュされたトークンは非キャッシュのレート制限から除外されるが、割引はされない。

Dedicated Inference(専用推論)

Dedicated Inferenceは単一の組織向けに容量を確保するもので、予測可能な性能が必要な本番用途にCerebrasが示す選択肢である。標準のモデルバージョンと並べて、ファインチューニングした重みをデプロイすることもできる。デプロイごとに容量、ドラフトモデル、モデル構成、量子化を調整でき、Shared Inferenceの全機能に加えてファインチューニング、重み管理、サービスティア制御が使える。専用側で対応するモデルファミリーは、Qwen 3.8、Qwen3とQwen3-Coder、Llama 3とLlama 4、GLM 4.Xと5.X、Kimi K2.X、DeepSeek V3.Xである。

Batch API

Batch APIはリクエストのまとまりを非同期で処理し、バッチリクエストは24時間以内の完了が保証される。

Cerebras Code

Cerebras Codeは、自分のエディターから使うことを想定したコーディング向けサブスクリプションである。製品ページではGLM 4.7で毎秒1,000トークン超のコード生成を行うとしているが、APIの非推奨ログの記載は異なる。

学習とファインチューニング

Cerebras Training Cloudは、同じシンプルなコードで10億から数十兆パラメータのモデルを学習・ファインチューニングできる手段として説明されている。

CS-4とWSE-3 Turboハードウェア

CS-4システムはWSE-3 Turboプロセッサで動作する。Cerebrasによれば、このプロセッサは4兆個のトランジスタと90万個のAIコアを備え、250 PFLOPSの演算性能と毎秒43.2ペタバイトのメモリ帯域幅を実現する。CS-4のページは今四半期に初回出荷が始まるとしているが、日付は示していない。

ガイド

APIの使い始め方

  1. Cloud Consoleを開いてサインアップまたはログインし、左側ナビゲーションのAPI Keysでキーを作成する。
  2. 支払い方法を追加する。支払い方法がないと、PlaygroundとAPIへのアクセスは無効のままになる。
  3. 公式SDKをインストールする。Python用はpipでcerebras_cloud_sdk、Node.js用はnpmで@cerebras/cerebras_cloud_sdkとして公開されている。既存のOpenAIクライアントをCerebrasのbase URLに向けてもよい。
  4. Playgroundでモデルを評価し、プロンプトを改良し、ツール呼び出しをテストし、パラメータを調整して、動くリクエストをコードとしてエクスポートする。応答ごとにトークン使用量、推論時間、毎秒トークン数、往復時間が表示されるため、自分のプロンプトで実際の速度をすばやく確かめられる。
  5. max_completion_tokensを現実的な値に設定する。Cerebrasはプロンプトにこのパラメータまたは独自の出力見積もりを加えて各リクエストを見積もり、見積もりが残りのクォータを超えるリクエストは処理開始前にレート制限される。

Cerebrasの活用事例と使用例

Cerebrasは、トークン待ちが製品の足を引っ張るワークロードを軸に活用事例を示している。

  • コーディングアシスタント:コードの作成・デバッグ・リファクタリングを即座に回せることを打ち出し、公開事例はCognitionである。
  • マルチステップエージェント:エージェントのワークフローを遅延やタイムアウトなしに動かすことを目指し、例としてNinjaTechを挙げる。
  • 検索、コパイロット、分析:1秒未満での複雑な推論をうたい、例はAlphaSenseである。
  • 音声インターフェース:即時かつ正確な音声応答を売りとし、例はTavusである。
  • アプリ内のエンタープライズ検索:Notionは、Cerebrasがエンタープライズ検索などのリアルタイム機能を支えていると述べている。
  • ライフサイエンスの研究エージェント:GSKは、Cerebrasの推論速度を生かして、研究者や創薬業務向けのインテリジェントな研究エージェントなどのアプリケーションを構築していると述べている。
  • オフラインの一括処理:Batch APIのドキュメントは、評価パイプライン、データラベリング、大量のコンテンツ生成、リサーチ分析を挙げている。

最も目立つ導入例は外部にある。2026年2月、独立系テクノロジーメディアは、より高速な推論とリアルタイムの共同作業向けに設計された小型のCodexモデルであるOpenAIのGPT-5.3-Codex-Sparkが、CerebrasのWafer Scale Engine 3上で動いていると報じた。

対象ユーザー

Cerebrasは応答速度が製品を左右するチームに向くが、適した入口は段階によって異なる。

  • 速度を評価する開発者:セルフサーブのDeveloperティアは開発、評価、実験向けで、本番利用向けではない。
  • 本番運用チーム:EnterpriseはDeveloperティアにはない本番対応の容量、最優先の処理、より高いレート制限、強化されたレイテンシのオプションを加える。
  • データセンターやフロンティアAIの運営者:CS-4はフロンティアAIのインフラとして、ハイパースケールでの導入を想定して設計されている。

サポートもティアで異なる。DeveloperアカウントはコミュニティのDiscordが頼りで、Enterpriseの顧客には専任のアカウントチームが付く。

恒久的な無料枠、セルフサーブのエンドポイントでの非常に長いコンテキストウィンドウ、幅広いセルフサーブのモデル選択を期待する人には向きにくい。詳細は価格、制限事項、機能の各セクションにある。

プラットフォーム

  • SDK:CerebrasはOpenAI互換のアクセスに加え、専用のPythonとTypeScriptのSDKを提供している。
  • パートナー経由:Cerebras InferenceはAWS Marketplaceでも販売され、統合APIのOpenRouterからも利用できる。
  • Hugging FaceとVercel:Cerebras搭載のモデルはHugging Face Hubから呼び出せ、Cerebrasの推論エンドポイントはVercelにデプロイできる。
  • コーディングツール:Cerebras Codeは、Cline、OpenCode、Crushなど、APIキーを受け付けるあらゆるエディターやエージェントで使える。
  • デプロイ場所:モデルはクラウドとオンプレミスで提供され、Cerebrasはレイテンシ、データレジデンシー、コンプライアンス上の義務への対応を助けるため、推論をリージョン内で実行するとしている。
  • チームでのアクセス:組織はOrganization Admin、Project AdminまたはProject Memberのロールを割り当て、プロジェクト管理者は担当プロジェクト内でAPIキーを管理する。

価格

Cerebras API料金は、セルフサーブのDeveloperティアでは従量課金で、無料の$5クレジットから始まる。Enterpriseの料金は問い合わせに応じて見積もられる。

モデル(Developerティア)入力出力
GPT OSS 120B$0.35/100万トークン$0.75/100万トークン
Qwen 3.8 27B$0.99/100万トークン$1.49/100万トークン
  • $5クレジットは有効な支払い方法が必要な1回限りのプロモーションクレジットで、有効化から30日後に失効する。カードを登録しても有料利用に申し込んだことにはならず、クレジットが失効するか使い切られると、従量課金クレジットを購入しない限りAPIとPlaygroundへのアクセスは一時停止する。
  • 無料トライアルは期間とクレジットの両方で区切られているため、恒久的な無料枠はない。
  • プロンプトキャッシュに追加料金はかからないが、キャッシュされた入力トークンは標準の入力トークン料金で課金される。
  • 自動チャージはデフォルトでオフで、Pay as you goタブからオンにできる。
  • Cloud ConsoleのSubscriptionsタブではモデル別の推論プランを管理でき、各プランは月額の異なる複数の段階で提供される。
  • カスタムモデルの重みや、ファインチューニングまたは学習のサービスは、契約によってのみ利用できるEnterprise機能である。

Cerebras Codeのプラン

Cerebras Code Proは1日最大2,400万トークンで$50と表示され、個人開発者や週末のプロジェクト向けである。Cerebras Code Maxは1日最大1億2,000万トークンで$200と表示され、フルタイムの開発やマルチエージェントシステム向けである。2026年10月4日の取得時点で両有料プランとも売り切れと表示されており、本ページのために確認したプランカードには請求期間の記載がない。

Training Cloud

Training Cloudは、提出したワークロードに必要な時間をCerebrasが見積もる時間単位か、Cerebrasの専門家がユーザーのデータセットでモデルを設計・ファインチューニングするモデル単位で販売される。Training Cloudのページはこれらの選択肢を料金なしで掲載している。

Cerebrasの代替ツール

標準的なGPUを借りる代わりに、高速推論向けの独自シリコンを作るベンダーはほかにもある。

  • Groq:Groqは自社のLPUを基盤とする高速推論向けネオクラウドを名乗り、LPUは現在LPXを通じてNVIDIAのGPUと連携して動く。
  • SambaNova SambaCloud:SambaNovaは、自社のRDUチップによりSambaCloudが最大級のモデルでも高速推論を提供できるとしている。SambaCloudはDeepSeek、Llama、Qwenなどのオープンソースファミリーに対応する。

これらと比べると、Cerebrasはウェハースケールプロセッサ、$5のセルフサーブ試用が付いたOpenAI互換API、CS-4システムをオンプレミスに設置できる選択肢が際立つ一方、セルフサーブのカタログは2モデルに限られる。

制限事項

レート制限とコンテキストウィンドウ

  • 無料トライアルでは、Shared Inferenceの各モデルが毎分5リクエスト、毎分3万の非キャッシュトークン、毎分9万の総トークン、1時間あたりと1日あたりそれぞれ100万トークンに制限され、qwen-3.8-27bは10 MiBのペイロード内で1リクエストあたり2枚の画像を受け付ける。
  • Developerティアでは、gpt-oss-120bが毎分100万の非キャッシュトークンと毎分1,000リクエスト、qwen-3.8-27bが毎分15万の非キャッシュトークンと毎分300リクエストを許容し、qwen-3.8-27bの総量制限は45万から75万へ一時的に引き上げられている。
  • 制限はユーザー単位ではなく組織単位で適用され、モデルごとに異なる。
  • 容量は一定間隔でリセットされるのではなく、トークンバケットアルゴリズムで継続的に補充される。429エラーは、非キャッシュと総トークンのどちらの制限を超えたかを示す。
  • キャッシュされたトークンは非キャッシュ制限に数えられず、総量制限はデフォルトで非キャッシュ制限の3倍なので、キャッシュヒット率がスループットを直接左右する。

ユーザーの報告も同じ方向を指している。CerebrasでのQwen 3.8 27B提供開始をめぐる公開の開発者ディスカッションでは、複数の開発者が、Cerebrasが許容する128kのコンテキストは長いエージェント作業やコーディング作業には小さすぎると述べた。同じスレッドの別の参加者は、パブリックエンドポイントの15万TPMの制限のせいで、多くのコーディング作業にこのモデルを使いにくいと述べた。Cerebras CodeがQwen3 Coderで動いていた2025年9月に書かれたITメディアのオピニオンコラムは、生成が10〜20秒ほど飛ぶように進んだ後、毎分のトークン上限で429エラーが出て、その1分がリセットされるまで続いたと報じた。

カタログの入れ替えとプレビュー機能

  • 2026年9月3日以降、gemma-4-31bはShared Inferenceでは提供されないが、Dedicated Inferenceには残る。
  • 非推奨ログはzai-glm-4.7を2026-08-17に非推奨としているが、Cerebras CodeのページはまだGLM 4.7をうたっており、2つの公式ページは一致していない。
  • BatchはSDK非対応のPrivate Preview段階にあり、バッチジョブはcURLか直接のHTTPリクエストで送信する。
  • リクエストの優先度付けのためのサービスティアは、Shared Inferenceでは使えない。

API互換性のギャップ

  • サポートされるのはn: 1のみで、外部のHTTPS画像URLに対応しないため、画像はbase64のPNGまたはJPEGのdata URIで送る必要がある。
  • gpt-oss-120bは、toolsとresponse_formatを組み合わせたリクエストを拒否する。
  • 画像に埋め込まれたテキストはプロンプトのコンテキストに入るため、プロンプトが画像に基づく回答を求めると、敵対的な指示を含む画像によってモデルがその指示に従うおそれがある。

性能の主張

Cerebrasは、自社の性能比較が第三者のベンチマークまたは社内テストに基づくものであり、GPUシステムに対して観測される速度向上はワークロード、構成、日付、モデルによって変わりうるとしている。

プライバシー、データ利用、規約

  • プライバシーポリシーによれば、Cerebrasは学習・推論・チャットボットの各サービスの入力と出力を保持せず、関連ログはサービス提供に不要になった時点で削除する。
  • Cerebrasは、PlaygroundとAPIのリクエストをモデルの学習に使うことは決してないと述べている。
  • これとは別に、Batchのドキュメントは、バッチ結果を完了後7日間保持した後に自動削除するとしている。
  • Trust Centerはコンプライアンスの項目にSOC 2 Type 2、GDPR、CCPAを挙げ、セキュリティ文書は要請に応じて提供される。
  • API利用では、モデル出力の所有権はサードパーティのモデル規約に従い、Cerebrasはその所有権を主張しない。
  • アカウントの利用には、13歳以上または居住国のデジタル同意の最低年齢以上であることが求められる。
  • Cloud Consoleにはセルフサービスのアカウント削除機能がないため、削除の依頼はサポートに送る。

よくある質問

Q1. $5の試用クレジットを使い切るとどうなる?

APIとPlaygroundへのアクセスは止まるが、APIキー、プロジェクト、設定はそのまま残る。従量課金で購入すればDeveloperティアでアクセスが再開され、このティアには1時間あたりや1日あたりのトークン上限がない。

Q2. Cerebrasは既存のモデルIDの裏でモデルを変更しうるか?

Cerebrasは、既存のモデルIDには元の重みを改変せずに提供し、将来枝刈りした派生版を出す場合は別のモデルIDでリリースするとしている。

Q3. OpenAI SDKはDedicated Inferenceで使える?

使える。OpenAI互換のmodelフィールドには、Shared Inferenceでは正確なモデルIDを、Dedicated Inferenceでは安定したエンドポイントIDを指定する。エンドポイントIDは各リクエストを現在アクティブなデプロイへルーティングする。

類似のツールをご存知ですか?
他の素晴らしいAIツールをご存知でしたら、ぜひ私たちに提出してください