Cerebras 是一個 AI 推論平台,在公司自行研發的晶圓級處理器上執行開放權重語言模型。開發者透過 Cerebras Inference 使用它,這是一套附瀏覽器 Playground 的雲端 API;規模更大的組織可以預留 Dedicated 專用容量,或在自家資料中心安裝 Cerebras 系統,同一套硬體也支撐訓練與微調服務。
公有雲層級在共用端點上提供定期更新的模型陣容,以 API 金鑰呼叫。
速度是核心賣點。Cerebras 稱其最新的機架級系統 CS-4 推論速度最高可比 GPU 快 30 倍,這是廠商數據,而非獨立量測結果。
產品背後的公司 Cerebras Systems 在 2026 年 5 月 IPO 中募得 55 億美元,獨立商業報導列出的客戶包括 OpenAI、G42、穆罕默德·本·扎耶德人工智慧大學和 Amazon Web Services。
模型保真度的文件細緻得少見。Cerebras 聲明 Shared Inference 上的每個模型都是未經剪枝的原始版本。權重採用選擇性的僅權重量化,以部分 16、8 或 4 位元格式儲存,敏感層維持全精度,激活值、注意力與 KV 快取都不量化。比較快速 AI 推論服務商時,這說明了速度數字背後實際提供的是什麼。
提示詞快取會在所有支援的 API 請求上自動生效,不需設定快取中斷點或修改程式碼。Cerebras 保證快取存活時間(TTL)為 5 分鐘,視系統負載,項目最長可能保留 1 小時。好處在於容量而非價格:快取 token 不計入未快取速率限制,但不打折。
Dedicated Inference 為單一組織預留容量,是 Cerebras 為需要可預測效能的正式環境工作所指出的方案。它也讓團隊在標準模型版本之外部署微調後的權重。每個部署都可針對容量、草稿模型、模型設定與量化調整,並在 Shared Inference 全部功能之上加入微調、權重管理與服務層級控制。專用端支援的模型系列包括 Qwen 3.8、Qwen3 與 Qwen3-Coder、Llama 3 與 Llama 4、GLM 4.X 與 5.X、Kimi K2.X 以及 DeepSeek V3.X。
Batch API 以非同步方式處理成批的請求,批次請求保證在 24 小時內完成。
Cerebras Code 是一項程式設計訂閱,設計成在你自己的編輯器中使用。其產品頁稱它執行 GLM 4.7 產生程式碼,速度超過每秒 1,000 個 token,但 API 棄用紀錄給出的說法不同。
Cerebras Training Cloud 被描述為能用同樣簡單的程式碼,訓練與微調 10 億到數十兆參數的模型。
CS-4 系統採用 WSE-3 Turbo 處理器,Cerebras 稱其擁有 4 兆個電晶體和 90 萬個 AI 核心,提供 250 PFLOPS 運算能力與每秒 43.2 PB 的記憶體頻寬。CS-4 頁面稱首批出貨將於本季開始,但未寫明日期。
Cerebras 圍繞「等待 token 會拖累產品」的工作負載來規劃使用情境:
最受矚目的部署來自外部。2026 年 2 月,獨立科技媒體報導,OpenAI 的 GPT-5.3-Codex-Spark(一款為更快推論與即時協作而設計的較小 Codex 模型)在 Cerebras 的 Wafer Scale Engine 3 上執行。
Cerebras 適合回應速度會改變產品的團隊,但合適的切入點取決於所處階段:
支援方式也依層級而異:Developer 帳號仰賴社群 Discord,Enterprise 客戶則有專屬客戶團隊。
如果你期待永久免費層級、自助端點上的超長上下文視窗或豐富的自助模型選擇,它就不太適合;細節見價格、限制與功能章節。
Cerebras API 價格方面,自助的 Developer 層級採隨用隨付,起步贈送 $5 免費額度;Enterprise 價格需洽詢報價。
| 模型(Developer 層級) | 輸入 | 輸出 |
|---|---|---|
| GPT OSS 120B | $0.35/百萬 token | $0.75/百萬 token |
| Qwen 3.8 27B | $0.99/百萬 token | $1.49/百萬 token |
Cerebras Code Pro 標價 $50,每天最多 2,400 萬個 token,鎖定獨立開發者與週末專案。Cerebras Code Max 標價 $200,每天最多 1.2 億個 token,鎖定全職開發與多代理系統。依 2026 年 10 月 4 日的擷取,兩個付費方案都標示為售罄,本頁核對的方案卡片也未寫明計費週期。
Training Cloud 有兩種販售方式:按小時計,由 Cerebras 評估所提交工作負載需要的時間;或按模型計,由 Cerebras 專家以你的資料集設計並微調模型。Training Cloud 頁面列出這些選項,但沒有標示費率。
其他廠商同樣打造客製晶片來做快速推論,而不是租用標準 GPU:
相較之下,Cerebras 的突出之處在於晶圓級處理器、附 $5 自助試用的 OpenAI 相容 API,以及可在地端安裝 CS-4 系統;不過其自助模型目錄只有兩個模型。
使用者回報也指向同一方向。在一場關於 Cerebras 推出 Qwen 3.8 27B 的公開開發者討論中,幾位開發者表示,Cerebras 允許的 128k 上下文對長時間的代理或程式設計任務來說太小。同一討論串中另有人表示,公開端點 15 萬 TPM 的限制讓該模型難以用於許多程式設計任務。一篇 2025 年 9 月的 IT 媒體評論專欄(撰寫時 Cerebras Code 執行的是 Qwen3 Coder)報導,生成先飛快地持續 10 到 20 秒,接著每分鐘 token 上限觸發 429 錯誤,直到該分鐘重設為止。
Cerebras 表示其效能比較是根據第三方基準測試或內部測試,相較 GPU 系統觀察到的速度提升可能因工作負載、設定、日期與模型而異。
API 與 Playground 存取會停止,但 API 金鑰、專案與設定都會保留;一次隨用隨付購買即可在 Developer 層級重新啟用存取,該層級沒有每小時或每天的 token 上限。
Cerebras 表示會為現有模型 ID 提供未經修改的原始權重,日後若有剪枝變體,會以獨立的模型 ID 發布。
可以。OpenAI 相容的 model 欄位在 Shared Inference 上填入確切的模型 ID,在 Dedicated Inference 上填入你的穩定端點 ID,後者會把每個請求路由到其目前啟用的部署。