Cerebrasは、自社開発のウェハースケールプロセッサ上でオープンウェイトの言語モデルを動かすAI推論プラットフォームである。開発者はブラウザのPlaygroundを備えたクラウドAPI、Cerebras Inferenceから利用する。大規模な組織はDedicatedの専用容量を予約したり、自社データセンターにCerebrasシステムを設置したりでき、同じハードウェアが学習とファインチューニングのサービスも支えている。
パブリッククラウド層では、定期的に更新されるモデルのラインナップを共有エンドポイントで提供し、APIキーで呼び出す。
最大の売りは速度だ。Cerebrasは最新のラック規模システムCS-4について、GPUより最大30倍高速な推論を実現するとしているが、これは独立した測定ではなくベンダーの数値である。
製品を手がけるCerebras Systemsは2026年5月のIPOで55億ドルを調達した。独立系のビジネス報道は、OpenAI、G42、Mohamed bin Zayed University of Artificial Intelligence、Amazon Web Servicesを顧客として挙げている。
モデルの忠実性は珍しいほど詳しく文書化されている。Cerebrasは、Shared Inferenceの全モデルが枝刈りされていないオリジナル版だと明言している。重みは選択的な重みのみの量子化により一部16、8または4ビット形式で保存され、敏感な層はフル精度のまま、活性化・アテンション・KVキャッシュは量子化されない。高速AI推論のプロバイダーを比較する人にとって、速度の数字の裏で実際に何が提供されているかがわかる情報だ。
プロンプトキャッシュは対応するすべてのAPIリクエストで自動的に働き、キャッシュブレークポイントの設定やコード変更は要らない。CerebrasはキャッシュのTTLとして5分を保証し、システム負荷によってはエントリが最大1時間残ることもある。利点は価格ではなく容量にある。キャッシュされたトークンは非キャッシュのレート制限から除外されるが、割引はされない。
Dedicated Inferenceは単一の組織向けに容量を確保するもので、予測可能な性能が必要な本番用途にCerebrasが示す選択肢である。標準のモデルバージョンと並べて、ファインチューニングした重みをデプロイすることもできる。デプロイごとに容量、ドラフトモデル、モデル構成、量子化を調整でき、Shared Inferenceの全機能に加えてファインチューニング、重み管理、サービスティア制御が使える。専用側で対応するモデルファミリーは、Qwen 3.8、Qwen3とQwen3-Coder、Llama 3とLlama 4、GLM 4.Xと5.X、Kimi K2.X、DeepSeek V3.Xである。
Batch APIはリクエストのまとまりを非同期で処理し、バッチリクエストは24時間以内の完了が保証される。
Cerebras Codeは、自分のエディターから使うことを想定したコーディング向けサブスクリプションである。製品ページではGLM 4.7で毎秒1,000トークン超のコード生成を行うとしているが、APIの非推奨ログの記載は異なる。
Cerebras Training Cloudは、同じシンプルなコードで10億から数十兆パラメータのモデルを学習・ファインチューニングできる手段として説明されている。
CS-4システムはWSE-3 Turboプロセッサで動作する。Cerebrasによれば、このプロセッサは4兆個のトランジスタと90万個のAIコアを備え、250 PFLOPSの演算性能と毎秒43.2ペタバイトのメモリ帯域幅を実現する。CS-4のページは今四半期に初回出荷が始まるとしているが、日付は示していない。
Cerebrasは、トークン待ちが製品の足を引っ張るワークロードを軸に活用事例を示している。
最も目立つ導入例は外部にある。2026年2月、独立系テクノロジーメディアは、より高速な推論とリアルタイムの共同作業向けに設計された小型のCodexモデルであるOpenAIのGPT-5.3-Codex-Sparkが、CerebrasのWafer Scale Engine 3上で動いていると報じた。
Cerebrasは応答速度が製品を左右するチームに向くが、適した入口は段階によって異なる。
サポートもティアで異なる。DeveloperアカウントはコミュニティのDiscordが頼りで、Enterpriseの顧客には専任のアカウントチームが付く。
恒久的な無料枠、セルフサーブのエンドポイントでの非常に長いコンテキストウィンドウ、幅広いセルフサーブのモデル選択を期待する人には向きにくい。詳細は価格、制限事項、機能の各セクションにある。
Cerebras API料金は、セルフサーブのDeveloperティアでは従量課金で、無料の$5クレジットから始まる。Enterpriseの料金は問い合わせに応じて見積もられる。
| モデル(Developerティア) | 入力 | 出力 |
|---|---|---|
| GPT OSS 120B | $0.35/100万トークン | $0.75/100万トークン |
| Qwen 3.8 27B | $0.99/100万トークン | $1.49/100万トークン |
Cerebras Code Proは1日最大2,400万トークンで$50と表示され、個人開発者や週末のプロジェクト向けである。Cerebras Code Maxは1日最大1億2,000万トークンで$200と表示され、フルタイムの開発やマルチエージェントシステム向けである。2026年10月4日の取得時点で両有料プランとも売り切れと表示されており、本ページのために確認したプランカードには請求期間の記載がない。
Training Cloudは、提出したワークロードに必要な時間をCerebrasが見積もる時間単位か、Cerebrasの専門家がユーザーのデータセットでモデルを設計・ファインチューニングするモデル単位で販売される。Training Cloudのページはこれらの選択肢を料金なしで掲載している。
標準的なGPUを借りる代わりに、高速推論向けの独自シリコンを作るベンダーはほかにもある。
これらと比べると、Cerebrasはウェハースケールプロセッサ、$5のセルフサーブ試用が付いたOpenAI互換API、CS-4システムをオンプレミスに設置できる選択肢が際立つ一方、セルフサーブのカタログは2モデルに限られる。
ユーザーの報告も同じ方向を指している。CerebrasでのQwen 3.8 27B提供開始をめぐる公開の開発者ディスカッションでは、複数の開発者が、Cerebrasが許容する128kのコンテキストは長いエージェント作業やコーディング作業には小さすぎると述べた。同じスレッドの別の参加者は、パブリックエンドポイントの15万TPMの制限のせいで、多くのコーディング作業にこのモデルを使いにくいと述べた。Cerebras CodeがQwen3 Coderで動いていた2025年9月に書かれたITメディアのオピニオンコラムは、生成が10〜20秒ほど飛ぶように進んだ後、毎分のトークン上限で429エラーが出て、その1分がリセットされるまで続いたと報じた。
Cerebrasは、自社の性能比較が第三者のベンチマークまたは社内テストに基づくものであり、GPUシステムに対して観測される速度向上はワークロード、構成、日付、モデルによって変わりうるとしている。
APIとPlaygroundへのアクセスは止まるが、APIキー、プロジェクト、設定はそのまま残る。従量課金で購入すればDeveloperティアでアクセスが再開され、このティアには1時間あたりや1日あたりのトークン上限がない。
Cerebrasは、既存のモデルIDには元の重みを改変せずに提供し、将来枝刈りした派生版を出す場合は別のモデルIDでリリースするとしている。
使える。OpenAI互換のmodelフィールドには、Shared Inferenceでは正確なモデルIDを、Dedicated Inferenceでは安定したエンドポイントIDを指定する。エンドポイントIDは各リクエストを現在アクティブなデプロイへルーティングする。