Cerebras 是一个 AI 推理平台,在公司自研的晶圆级处理器上运行开放权重语言模型。开发者通过 Cerebras Inference 使用它,这是一套带浏览器 Playground 的云端 API;规模更大的机构可以预留 Dedicated 专用容量,或在自有数据中心部署 Cerebras 系统,同一套硬件也支撑训练与微调服务。
公共云层级在共享端点上提供定期更新的模型阵容,用 API 密钥调用。
速度是核心卖点。Cerebras 称其最新的机架级系统 CS-4 推理速度最高可比 GPU 快 30 倍,这是厂商数据,而非独立测量结果。
产品背后的公司 Cerebras Systems 在 2026 年 5 月 IPO 中募资 55 亿美元,独立商业报道列出的客户包括 OpenAI、G42、穆罕默德·本·扎耶德人工智能大学和亚马逊云科技。
模型保真度的文档细致得少见。Cerebras 声明 Shared Inference 上的每个模型都是未剪枝的原始版本。权重采用选择性的仅权重量化,以部分 16、8 或 4 位格式存储,敏感层保持全精度,激活值、注意力和 KV 缓存均不量化。对比快速 AI 推理服务商时,这说明了速度数字背后实际提供的是什么。
提示词缓存在所有受支持的 API 请求上自动生效,无需设置缓存断点或修改代码。Cerebras 保证缓存存活时间(TTL)为 5 分钟,视系统负载,条目最长可能保留 1 小时。好处在于容量而非价格:缓存 token 不计入未缓存速率限制,但不打折。
Dedicated Inference 为单个组织预留容量,是 Cerebras 为需要可预测性能的生产工作指出的方案。它还允许团队在标准模型版本之外部署微调后的权重。每个部署可针对容量、草稿模型、模型配置和量化进行调整,并在 Shared Inference 全部能力之上增加微调、权重管理和服务层级控制。专用端支持的模型系列包括 Qwen 3.8、Qwen3 与 Qwen3-Coder、Llama 3 与 Llama 4、GLM 4.X 与 5.X、Kimi K2.X 以及 DeepSeek V3.X。
Batch API 以异步方式处理成组的请求,批处理请求保证在 24 小时内完成。
Cerebras Code 是一项编程订阅,设计为在你自己的编辑器中使用。其产品页称它运行 GLM 4.7 生成代码,速度超过每秒 1000 个 token,但 API 弃用日志给出的说法不同。
Cerebras Training Cloud 被描述为可用同样简单的代码训练和微调 10 亿到数十万亿参数的模型。
CS-4 系统采用 WSE-3 Turbo 处理器,Cerebras 称其拥有 4 万亿个晶体管和 90 万个 AI 核心,提供 250 PFLOPS 算力和每秒 43.2 PB 的内存带宽。CS-4 页面称首批出货将于本季度开始,但未给出具体日期。
Cerebras 围绕“等待 token 会拖累产品”的工作负载来组织使用场景:
最显眼的部署来自外部。2026 年 2 月,独立科技媒体报道,OpenAI 的 GPT-5.3-Codex-Spark(一款为更快推理和实时协作设计的较小 Codex 模型)运行在 Cerebras 的 Wafer Scale Engine 3 上。
Cerebras 适合响应速度会改变产品的团队,但合适的入口取决于所处阶段:
支持方式也因层级而异:Developer 账户依靠社区 Discord,Enterprise 客户则有专属客户团队。
如果你期待永久免费层级、自助端点上的超长上下文窗口或丰富的自助模型选择,它就不太合适;具体情况见价格、限制与功能部分。
Cerebras API 价格方面,自助 Developer 层级按量付费,起步赠送 $5 免费额度;Enterprise 价格需询价。
| 模型(Developer 层级) | 输入 | 输出 |
|---|---|---|
| GPT OSS 120B | $0.35/百万 token | $0.75/百万 token |
| Qwen 3.8 27B | $0.99/百万 token | $1.49/百万 token |
Cerebras Code Pro 标价 $50,每天最多 2400 万 token,面向独立开发者和周末项目。Cerebras Code Max 标价 $200,每天最多 1.2 亿 token,面向全职开发和多智能体系统。按 2026 年 10 月 4 日的抓取,两个付费套餐均标为售罄,本页核查的套餐卡片也未注明计费周期。
Training Cloud 有两种售卖方式:按小时,由 Cerebras 评估所提交工作负载需要的时长;或按模型,由 Cerebras 专家基于你的数据集设计并微调模型。Training Cloud 页面列出这些选项,但未标价格。
其他厂商同样打造定制芯片来做快速推理,而不是租用标准 GPU:
与它们相比,Cerebras 的突出之处在于晶圆级处理器、附带 $5 自助试用的 OpenAI 兼容 API,以及可在本地部署 CS-4 系统;不过其自助模型目录仅有两个模型。
用户反馈也指向同一方向。在一场关于 Cerebras 上线 Qwen 3.8 27B 的公开开发者讨论中,几位开发者表示,Cerebras 允许的 128k 上下文对长时间的智能体或编程任务来说太小。同一讨论串中另有人表示,公共端点 15 万 TPM 的限制让该模型难以用于许多编程任务。一篇 2025 年 9 月的 IT 媒体评论专栏(撰写时 Cerebras Code 运行的是 Qwen3 Coder)报道,生成先飞快地持续 10 到 20 秒,随后每分钟 token 上限触发 429 错误,直到该分钟重置。
Cerebras 称其性能对比基于第三方基准测试或内部测试,相较 GPU 系统观察到的速度提升可能因工作负载、配置、日期和模型而异。
API 和 Playground 访问会停止,但 API 密钥、项目和设置保持不变;一次按量付费购买即可在 Developer 层级重新激活访问,该层级没有每小时或每天的 token 上限。
Cerebras 称其为现有模型 ID 提供未经修改的原始权重,今后如有剪枝变体,会以单独的模型 ID 发布。
可以。OpenAI 兼容的 model 字段在 Shared Inference 上填写确切的模型 ID,在 Dedicated Inference 上填写你的稳定端点 ID,后者会把每个请求路由到其当前活跃的部署。