Toolso.AI
Toolso.AI
所有工具分類熱門榜單最新工具價格部落格
Toolso.AI
Toolso.AI

💌訂閱 AI 工具週報

每週精選最新、最熱門的AI工具和行業動態,直達您的信箱 訂閱

Toolso.AI
Toolso.AI

發現最好的AI工具,提升你的工作效率

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

熱門分類

  • AI寫作
  • AI影象
  • AI影片
  • AI程式設計
  • 更多分類

探索發現

  • 最新收錄
  • 熱門推薦
  • 更多工具
  • 提交工具
  • 價格

關於

  • 關於我們
  • 聯絡我們
  • 部落格
  • 更新日誌

法律

  • Cookie政策
  • 隱私政策
  • 服務條款
  • 退款政策
© 2026 Toolso.AI 保留所有權利
限時推廣限時推廣加速推廣24h 優先審核 · 無需反鏈 · 30 天推薦展示$29.90到期後 $59.9010月31日後漲價至 $59.90距結束--:--:--立即提交
  1. 首頁
  2. 所有工具
  3. 開發工具
  4. Cerebras
Cerebras介面預覽
Cerebras標誌

Cerebras

Cerebras 在自家晶圓級處理器上執行 GPT OSS 120B、Qwen 3.8 27B 等開放權重模型,透過 OpenAI 相容 API 提供隨用隨付 token、預留的 Dedicated 專用容量與地端部署的 CS-4 系統。

開發工具AI開發AI訓練平台#企業版#大語言模型#OpenAI 兼容 API
查看定價
收藏
訪問次數
瀏覽次數
定價
付費
發布日期
2026年10月4日
網域
cerebras.ai
使用者評分

用過這個工具嗎?為它評分

為這個工具評分

Cerebras 工具資訊

查看定價
工具資訊
收藏
訪問次數
瀏覽次數
定價
付費
發布日期
2026年10月4日
網域
cerebras.ai
使用者評分

用過這個工具嗎?為它評分

為這個工具評分

推薦工具

相關工具推薦

查看定價

Cerebras 是什麼?

Cerebras 是一個 AI 推論平台,在公司自行研發的晶圓級處理器上執行開放權重語言模型。開發者透過 Cerebras Inference 使用它,這是一套附瀏覽器 Playground 的雲端 API;規模更大的組織可以預留 Dedicated 專用容量,或在自家資料中心安裝 Cerebras 系統,同一套硬體也支撐訓練與微調服務。

公有雲層級在共用端點上提供定期更新的模型陣容,以 API 金鑰呼叫。

速度是核心賣點。Cerebras 稱其最新的機架級系統 CS-4 推論速度最高可比 GPU 快 30 倍,這是廠商數據,而非獨立量測結果。

產品背後的公司 Cerebras Systems 在 2026 年 5 月 IPO 中募得 55 億美元,獨立商業報導列出的客戶包括 OpenAI、G42、穆罕默德·本·扎耶德人工智慧大學和 Amazon Web Services。

核心功能

Shared Inference 共用推論 API

  • OpenAI 相容 API:在許多常見工作流程中,Cerebras API 可直接搭配 OpenAI 用戶端函式庫使用,現有應用程式只要更換 API 金鑰、base URL 和目標模型即可切換。
  • 精簡的自助模型目錄:Shared Inference 目前列出 gpt-oss-120b(1,200 億參數,免費試用上下文 65k、付費層級 131k,約每秒 3,000 個 token)和 qwen-3.8-27b(270 億參數,上下文 64k/128k,約每秒 1,850 個 token)。
  • 簽約可用更多模型:其他模型系列僅透過 Dedicated Inference 提供。
  • 影像輸入:Shared Inference 上的 qwen-3.8-27b 支援影像輸入,gemma-4-31b 等其他支援影像的模型則需使用 Dedicated Inference。
  • 推理強度控制:qwen-3.8-27b 的推理強度可設為 none、low、medium 或 high,預設為 high,推理內容與答案分開回傳。

模型保真度的文件細緻得少見。Cerebras 聲明 Shared Inference 上的每個模型都是未經剪枝的原始版本。權重採用選擇性的僅權重量化,以部分 16、8 或 4 位元格式儲存,敏感層維持全精度,激活值、注意力與 KV 快取都不量化。比較快速 AI 推論服務商時,這說明了速度數字背後實際提供的是什麼。

提示詞快取

提示詞快取會在所有支援的 API 請求上自動生效,不需設定快取中斷點或修改程式碼。Cerebras 保證快取存活時間(TTL)為 5 分鐘,視系統負載,項目最長可能保留 1 小時。好處在於容量而非價格:快取 token 不計入未快取速率限制,但不打折。

Dedicated Inference 專用推論

Dedicated Inference 為單一組織預留容量,是 Cerebras 為需要可預測效能的正式環境工作所指出的方案。它也讓團隊在標準模型版本之外部署微調後的權重。每個部署都可針對容量、草稿模型、模型設定與量化調整,並在 Shared Inference 全部功能之上加入微調、權重管理與服務層級控制。專用端支援的模型系列包括 Qwen 3.8、Qwen3 與 Qwen3-Coder、Llama 3 與 Llama 4、GLM 4.X 與 5.X、Kimi K2.X 以及 DeepSeek V3.X。

Batch API

Batch API 以非同步方式處理成批的請求,批次請求保證在 24 小時內完成。

Cerebras Code

Cerebras Code 是一項程式設計訂閱,設計成在你自己的編輯器中使用。其產品頁稱它執行 GLM 4.7 產生程式碼,速度超過每秒 1,000 個 token,但 API 棄用紀錄給出的說法不同。

訓練與微調

Cerebras Training Cloud 被描述為能用同樣簡單的程式碼,訓練與微調 10 億到數十兆參數的模型。

CS-4 與 WSE-3 Turbo 硬體

CS-4 系統採用 WSE-3 Turbo 處理器,Cerebras 稱其擁有 4 兆個電晶體和 90 萬個 AI 核心,提供 250 PFLOPS 運算能力與每秒 43.2 PB 的記憶體頻寬。CS-4 頁面稱首批出貨將於本季開始,但未寫明日期。

使用指南

API 入門

  1. 開啟 Cloud Console,註冊或登入,在左側導覽列的 API Keys 下建立金鑰。
  2. 新增付款方式,否則 Playground 與 API 存取會一直維持未啟用狀態。
  3. 安裝官方 SDK:Python 版以 pip 安裝 cerebras_cloud_sdk,Node.js 版以 npm 安裝 @cerebras/cerebras_cloud_sdk;也可以把現有 OpenAI 用戶端指向 Cerebras 的 base URL。
  4. 用 Playground 評估模型、反覆調整提示詞、測試工具呼叫、調整參數,並把可用的請求匯出成程式碼。每次回應後它會顯示 token 用量、推論時間、每秒 token 數與往返時間,能快速檢驗你自己的提示詞的實際速度。
  5. 把 max_completion_tokens 設為符合實際的值。Cerebras 會以提示詞加上該參數或其自身的輸出估計來估算每個請求,估算值超過剩餘配額的請求會在處理開始前被限速。

Cerebras 使用情境與範例

Cerebras 圍繞「等待 token 會拖累產品」的工作負載來規劃使用情境:

  • 程式設計助理:Cerebras 主打即時的寫程式、除錯與重構循環,公開的案例研究是 Cognition。
  • 多步驟代理:代理工作流程的目標是不延遲、不逾時地執行,以 NinjaTech 為例。
  • 搜尋、AI 副駕駛與分析:這裡的說法是在一秒內完成複雜推理,以 AlphaSense 為例。
  • 語音介面:賣點是即時、準確的語音回應,以 Tavus 為例。
  • 應用程式內企業搜尋:Notion 表示 Cerebras 為其企業搜尋等即時功能提供動力。
  • 生命科學研究代理:GSK 表示正利用 Cerebras 的推論速度,為研究人員與藥物研發工作打造智慧研究代理等應用。
  • 離線批次作業:Batch API 文件列出評估管線、資料標註、大量內容生成與研究分析。

最受矚目的部署來自外部。2026 年 2 月,獨立科技媒體報導,OpenAI 的 GPT-5.3-Codex-Spark(一款為更快推論與即時協作而設計的較小 Codex 模型)在 Cerebras 的 Wafer Scale Engine 3 上執行。

適用人群

Cerebras 適合回應速度會改變產品的團隊,但合適的切入點取決於所處階段:

  • 評估速度的開發者:自助的 Developer 層級用於開發、評估與實驗,而非正式環境使用。
  • 正式環境團隊:Enterprise 加入 Developer 層級沒有的正式環境級容量、最高優先順序、更高速率限制與強化的延遲選項。
  • 資料中心與前沿 AI 營運者:CS-4 設計為以超大規模部署,作為前沿 AI 的基礎設施。

支援方式也依層級而異:Developer 帳號仰賴社群 Discord,Enterprise 客戶則有專屬客戶團隊。

如果你期待永久免費層級、自助端點上的超長上下文視窗或豐富的自助模型選擇,它就不太適合;細節見價格、限制與功能章節。

支援平台

  • SDK:Cerebras 提供專屬的 Python 與 TypeScript SDK,同時支援 OpenAI 相容存取。
  • 合作通路:Cerebras Inference 也透過 AWS Marketplace 銷售,並可經由統一的 OpenRouter API 呼叫。
  • Hugging Face 與 Vercel:可從 Hugging Face Hub 呼叫由 Cerebras 驅動的模型,Cerebras 推論端點也能部署在 Vercel 上。
  • 程式設計工具:Cerebras Code 可搭配任何接受 API 金鑰的編輯器或代理,包括 Cline、OpenCode 與 Crush。
  • 部署位置:模型以雲端與地端兩種方式提供,Cerebras 表示推論在區域內執行,有助於因應延遲、資料落地與法規遵循方面的義務。
  • 團隊存取:組織可指派 Organization Admin、Project Admin 或 Project Member 角色,專案管理員在其被指派的專案內管理 API 金鑰。

價格套餐

Cerebras API 價格方面,自助的 Developer 層級採隨用隨付,起步贈送 $5 免費額度;Enterprise 價格需洽詢報價。

模型(Developer 層級)輸入輸出
GPT OSS 120B$0.35/百萬 token$0.75/百萬 token
Qwen 3.8 27B$0.99/百萬 token$1.49/百萬 token
  • $5 額度是一次性的促銷額度,需綁定有效付款方式,啟用後 30 天到期;新增信用卡並不會讓你開始付費使用,額度到期或用完後,除非購買隨用隨付額度,否則 API 與 Playground 存取會暫停。
  • 沒有永久免費層級,因為免費試用同時受時間與額度限制。
  • 提示詞快取不另外收費,但快取的輸入 token 依標準輸入費率計費。
  • 自動儲值預設關閉,可在 Pay as you go 分頁開啟。
  • Cloud Console 的 Subscriptions 分頁管理依模型劃分的推論方案,每種方案分級提供,月費各不相同。
  • 自訂模型權重以及微調或訓練服務屬於 Enterprise 功能,僅依協議提供。

Cerebras Code 方案

Cerebras Code Pro 標價 $50,每天最多 2,400 萬個 token,鎖定獨立開發者與週末專案。Cerebras Code Max 標價 $200,每天最多 1.2 億個 token,鎖定全職開發與多代理系統。依 2026 年 10 月 4 日的擷取,兩個付費方案都標示為售罄,本頁核對的方案卡片也未寫明計費週期。

Training Cloud

Training Cloud 有兩種販售方式:按小時計,由 Cerebras 評估所提交工作負載需要的時間;或按模型計,由 Cerebras 專家以你的資料集設計並微調模型。Training Cloud 頁面列出這些選項,但沒有標示費率。

Cerebras 替代方案

其他廠商同樣打造客製晶片來做快速推論,而不是租用標準 GPU:

  • Groq:Groq 自稱是以自家 LPU 打造的快速推論新型雲端(neocloud),LPU 現已透過 LPX 與 NVIDIA GPU 協同運作。
  • SambaNova SambaCloud:SambaNova 表示其 RDU 晶片讓 SambaCloud 能在最大的模型上提供快速推論。SambaCloud 支援 DeepSeek、Llama 與 Qwen 等開源模型系列。

相較之下,Cerebras 的突出之處在於晶圓級處理器、附 $5 自助試用的 OpenAI 相容 API,以及可在地端安裝 CS-4 系統;不過其自助模型目錄只有兩個模型。

注意事項

速率限制與上下文視窗

  • 免費試用期間,每個 Shared Inference 模型的上限為每分鐘 5 次請求、每分鐘 3 萬個未快取 token、每分鐘 9 萬個總 token,以及每小時與每天各 100 萬個 token;qwen-3.8-27b 每次請求可接受 2 張圖片,酬載上限為 10 MiB。
  • Developer 層級下,gpt-oss-120b 允許每分鐘 100 萬個未快取 token 與每分鐘 1,000 次請求;qwen-3.8-27b 允許每分鐘 15 萬個未快取 token 與每分鐘 300 次請求,其總量限制已從 45 萬暫時調高至 75 萬。
  • 限制以組織而非使用者為單位計算,並依模型而異。
  • 容量依權杖桶演算法持續補充,而不是按固定間隔重設;429 錯誤會說明超出的是未快取 token 限制還是總 token 限制。
  • 快取 token 不計入未快取限制,總量限制預設為未快取限制的三倍,因此快取命中率直接影響吞吐量。

使用者回報也指向同一方向。在一場關於 Cerebras 推出 Qwen 3.8 27B 的公開開發者討論中,幾位開發者表示,Cerebras 允許的 128k 上下文對長時間的代理或程式設計任務來說太小。同一討論串中另有人表示,公開端點 15 萬 TPM 的限制讓該模型難以用於許多程式設計任務。一篇 2025 年 9 月的 IT 媒體評論專欄(撰寫時 Cerebras Code 執行的是 Qwen3 Coder)報導,生成先飛快地持續 10 到 20 秒,接著每分鐘 token 上限觸發 429 錯誤,直到該分鐘重設為止。

模型目錄變動與預覽功能

  • 自 2026 年 9 月 3 日起,gemma-4-31b 不再於 Shared Inference 提供,但仍可在 Dedicated Inference 上使用。
  • 棄用紀錄將 zai-glm-4.7 列為於 2026-08-17 棄用,而 Cerebras Code 頁面仍在宣傳 GLM 4.7,兩個官方頁面並不一致。
  • Batch 處於 Private Preview 階段且不支援 SDK,因此批次作業需透過 cURL 或直接的 HTTP 請求提交。
  • Shared Inference 不提供用於排定請求優先順序的服務層級。

API 相容性落差

  • 只支援 n: 1;圖片必須以 base64 PNG 或 JPEG data URI 傳送,因為不支援外部 HTTPS 圖片網址。
  • gpt-oss-120b 會拒絕同時使用 tools 與 response_format 的請求。
  • 圖片中嵌入的文字會進入提示詞上下文,因此當提示詞要求依圖片作答時,帶有對抗性指令的圖片可能讓模型照著執行。

效能說法

Cerebras 表示其效能比較是根據第三方基準測試或內部測試,相較 GPU 系統觀察到的速度提升可能因工作負載、設定、日期與模型而異。

隱私、資料使用與條款

  • 隱私權政策表示,Cerebras 不保留其訓練、推論與聊天機器人服務的輸入與輸出,並在相關紀錄不再為提供服務所需時予以刪除。
  • Cerebras 聲明 Playground 與 API 請求絕不會用於訓練模型。
  • 另外,Batch 文件表示批次結果在完成後保留 7 天,之後自動刪除。
  • Trust Center 在法規遵循項下列出 SOC 2 Type 2、GDPR 與 CCPA,安全性文件可應要求提供。
  • 就 API 使用而言,模型輸出的所有權受第三方模型條款規範,Cerebras 不主張擁有其所有權。
  • 帳號要求使用者年滿 13 歲,或達到所在國家的數位同意最低年齡。
  • Cloud Console 不提供自助刪除帳號功能,刪除請求需提交給支援團隊。

FAQ

Q1. $5 試用額度用完後會怎樣?

API 與 Playground 存取會停止,但 API 金鑰、專案與設定都會保留;一次隨用隨付購買即可在 Developer 層級重新啟用存取,該層級沒有每小時或每天的 token 上限。

Q2. Cerebras 會在現有模型 ID 背後更換模型嗎?

Cerebras 表示會為現有模型 ID 提供未經修改的原始權重,日後若有剪枝變體,會以獨立的模型 ID 發布。

Q3. OpenAI SDK 能用於 Dedicated Inference 嗎?

可以。OpenAI 相容的 model 欄位在 Shared Inference 上填入確切的模型 ID,在 Dedicated Inference 上填入你的穩定端點 ID,後者會把每個請求路由到其目前啟用的部署。

發現類似工具?
如果你知道其他優秀的AI工具,歡迎提交給我們