Toolso.AI
Toolso.AI
所有工具分类热门榜单最新工具价格博客
Toolso.AI
Toolso.AI

💌订阅 AI 工具周报

每周精选最新、最热门的AI工具和行业动态,直达您的邮箱 订阅

Toolso.AI
Toolso.AI

发现最好的AI工具,提升你的工作效率

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

热门分类

  • AI写作
  • AI图像
  • AI视频
  • AI编程
  • 更多分类

探索发现

  • 最新收录
  • 热门推荐
  • 更多工具
  • 提交工具
  • 价格

关于

  • 关于我们
  • 联系我们
  • 博客
  • 更新日志

法律

  • Cookie政策
  • 隐私政策
  • 服务条款
  • 退款政策
© 2026 Toolso.AI 保留所有权利
限时推广限时推广加速推广24h 优先审核 · 无需反链 · 30 天推荐展示$29.90到期后 $59.9010月31日后涨价至 $59.90距结束--:--:--立即提交
  1. 首页
  2. 所有工具
  3. 开发工具
  4. Cerebras
Cerebras界面预览
Cerebras标志

Cerebras

Cerebras 在自研晶圆级处理器上运行 GPT OSS 120B、Qwen 3.8 27B 等开放权重模型,通过 OpenAI 兼容 API 提供按量付费 token、预留的 Dedicated 专用容量和本地部署的 CS-4 系统。

开发工具AI开发AI训练平台#企业版#大语言模型#OpenAI 兼容 API
查看定价
收藏
访问次数
浏览次数
定价
付费
发布日期
2026年10月4日
域名
cerebras.ai
用户评分

用过这个工具吗?给它评分

为这个工具评分

Cerebras 工具信息

查看定价
工具信息
收藏
访问次数
浏览次数
定价
付费
发布日期
2026年10月4日
域名
cerebras.ai
用户评分

用过这个工具吗?给它评分

为这个工具评分

推荐工具

相关工具推荐

查看定价

Cerebras 是什么?

Cerebras 是一个 AI 推理平台,在公司自研的晶圆级处理器上运行开放权重语言模型。开发者通过 Cerebras Inference 使用它,这是一套带浏览器 Playground 的云端 API;规模更大的机构可以预留 Dedicated 专用容量,或在自有数据中心部署 Cerebras 系统,同一套硬件也支撑训练与微调服务。

公共云层级在共享端点上提供定期更新的模型阵容,用 API 密钥调用。

速度是核心卖点。Cerebras 称其最新的机架级系统 CS-4 推理速度最高可比 GPU 快 30 倍,这是厂商数据,而非独立测量结果。

产品背后的公司 Cerebras Systems 在 2026 年 5 月 IPO 中募资 55 亿美元,独立商业报道列出的客户包括 OpenAI、G42、穆罕默德·本·扎耶德人工智能大学和亚马逊云科技。

核心功能

Shared Inference 共享推理 API

  • OpenAI 兼容 API:在许多常见工作流中,Cerebras API 可直接配合 OpenAI 客户端库使用,现有应用只需更换 API 密钥、base URL 和目标模型即可切换。
  • 精简的自助模型目录:Shared Inference 目前列出 gpt-oss-120b(1200 亿参数,免费试用上下文 65k、付费层级 131k,约 3000 token/秒)和 qwen-3.8-27b(270 亿参数,上下文 64k/128k,约 1850 token/秒)。
  • 签约可用更多模型:其他模型系列仅通过 Dedicated Inference 提供。
  • 图像输入:Shared Inference 上的 qwen-3.8-27b 支持图像输入,gemma-4-31b 等其他支持图像的模型则需使用 Dedicated Inference。
  • 推理强度控制:qwen-3.8-27b 的推理强度可设为 none、low、medium 或 high,默认 high,推理内容与答案分开返回。

模型保真度的文档细致得少见。Cerebras 声明 Shared Inference 上的每个模型都是未剪枝的原始版本。权重采用选择性的仅权重量化,以部分 16、8 或 4 位格式存储,敏感层保持全精度,激活值、注意力和 KV 缓存均不量化。对比快速 AI 推理服务商时,这说明了速度数字背后实际提供的是什么。

提示词缓存

提示词缓存在所有受支持的 API 请求上自动生效,无需设置缓存断点或修改代码。Cerebras 保证缓存存活时间(TTL)为 5 分钟,视系统负载,条目最长可能保留 1 小时。好处在于容量而非价格:缓存 token 不计入未缓存速率限制,但不打折。

Dedicated Inference 专用推理

Dedicated Inference 为单个组织预留容量,是 Cerebras 为需要可预测性能的生产工作指出的方案。它还允许团队在标准模型版本之外部署微调后的权重。每个部署可针对容量、草稿模型、模型配置和量化进行调整,并在 Shared Inference 全部能力之上增加微调、权重管理和服务层级控制。专用端支持的模型系列包括 Qwen 3.8、Qwen3 与 Qwen3-Coder、Llama 3 与 Llama 4、GLM 4.X 与 5.X、Kimi K2.X 以及 DeepSeek V3.X。

Batch API

Batch API 以异步方式处理成组的请求,批处理请求保证在 24 小时内完成。

Cerebras Code

Cerebras Code 是一项编程订阅,设计为在你自己的编辑器中使用。其产品页称它运行 GLM 4.7 生成代码,速度超过每秒 1000 个 token,但 API 弃用日志给出的说法不同。

训练与微调

Cerebras Training Cloud 被描述为可用同样简单的代码训练和微调 10 亿到数十万亿参数的模型。

CS-4 与 WSE-3 Turbo 硬件

CS-4 系统采用 WSE-3 Turbo 处理器,Cerebras 称其拥有 4 万亿个晶体管和 90 万个 AI 核心,提供 250 PFLOPS 算力和每秒 43.2 PB 的内存带宽。CS-4 页面称首批出货将于本季度开始,但未给出具体日期。

使用指南

API 入门

  1. 打开 Cloud Console,注册或登录,在左侧导航的 API Keys 下创建密钥。
  2. 添加付款方式,否则 Playground 和 API 访问会一直处于未激活状态。
  3. 安装官方 SDK:Python 版通过 pip 安装 cerebras_cloud_sdk,Node.js 版通过 npm 安装 @cerebras/cerebras_cloud_sdk;也可以把现有 OpenAI 客户端指向 Cerebras 的 base URL。
  4. 用 Playground 评估模型、迭代提示词、测试工具调用、调整参数,并把可用的请求导出为代码。每次响应后它会显示 token 用量、推理时间、每秒 token 数和往返时间,可快速检验你自己的提示词的实际速度。
  5. 把 max_completion_tokens 设为符合实际的值。Cerebras 按提示词加上该参数或其自身的输出估算来估计每个请求,估计值超过剩余配额的请求会在处理开始前被限流。

Cerebras 使用场景与示例

Cerebras 围绕“等待 token 会拖累产品”的工作负载来组织使用场景:

  • 编程助手:Cerebras 主打即时的写代码、调试与重构循环,公开的案例研究是 Cognition。
  • 多步骤智能体:智能体工作流旨在无延迟、无超时地运行,以 NinjaTech 为例。
  • 搜索、AI 副驾与分析:这里的说法是一秒内完成复杂推理,以 AlphaSense 为例。
  • 语音界面:卖点是即时、准确的语音响应,以 Tavus 为例。
  • 应用内企业搜索:Notion 称 Cerebras 为其企业搜索等实时功能提供支持。
  • 生命科学研究智能体:GSK 称正利用 Cerebras 的推理速度,为研究人员和药物研发工作构建智能研究智能体等应用。
  • 离线批量任务:Batch API 文档列出评估流水线、数据标注、批量内容生成和研究分析。

最显眼的部署来自外部。2026 年 2 月,独立科技媒体报道,OpenAI 的 GPT-5.3-Codex-Spark(一款为更快推理和实时协作设计的较小 Codex 模型)运行在 Cerebras 的 Wafer Scale Engine 3 上。

适用人群

Cerebras 适合响应速度会改变产品的团队,但合适的入口取决于所处阶段:

  • 评估速度的开发者:自助的 Developer 层级面向开发、评估和实验,而非生产使用。
  • 生产团队:Enterprise 增加了 Developer 层级不包含的生产级容量、最高优先级、更高速率限制和增强的延迟选项。
  • 数据中心与前沿 AI 运营方:CS-4 设计为以超大规模部署,作为前沿 AI 的基础设施。

支持方式也因层级而异:Developer 账户依靠社区 Discord,Enterprise 客户则有专属客户团队。

如果你期待永久免费层级、自助端点上的超长上下文窗口或丰富的自助模型选择,它就不太合适;具体情况见价格、限制与功能部分。

支持平台

  • SDK:Cerebras 提供专门的 Python 和 TypeScript SDK,同时支持 OpenAI 兼容访问。
  • 合作渠道:Cerebras Inference 也通过 AWS Marketplace 销售,并可经由统一的 OpenRouter API 调用。
  • Hugging Face 与 Vercel:可从 Hugging Face Hub 调用由 Cerebras 驱动的模型,Cerebras 推理端点也可部署在 Vercel 上。
  • 编程工具:Cerebras Code 适用于任何接受 API 密钥的编辑器或智能体,包括 Cline、OpenCode 和 Crush。
  • 部署位置:模型以云端和本地部署两种方式提供,Cerebras 称推理在区域内运行,有助于满足延迟、数据驻留和合规方面的义务。
  • 团队访问:组织可分配 Organization Admin、Project Admin 或 Project Member 角色,项目管理员在其分配的项目内管理 API 密钥。

价格套餐

Cerebras API 价格方面,自助 Developer 层级按量付费,起步赠送 $5 免费额度;Enterprise 价格需询价。

模型(Developer 层级)输入输出
GPT OSS 120B$0.35/百万 token$0.75/百万 token
Qwen 3.8 27B$0.99/百万 token$1.49/百万 token
  • $5 额度是一次性促销额度,需绑定有效付款方式,激活后 30 天到期;添加银行卡并不会让你开通付费使用,额度到期或用完后,除非购买按量付费额度,否则 API 和 Playground 访问会暂停。
  • 不存在永久免费层级,因为免费试用同时受时间和额度限制。
  • 提示词缓存不额外收费,但缓存的输入 token 按标准输入价格计费。
  • 自动充值默认关闭,可在 Pay as you go 标签页开启。
  • Cloud Console 的 Subscriptions 标签页管理按模型划分的推理套餐,每种套餐分档提供,月费各不相同。
  • 自定义模型权重以及微调或训练服务属于 Enterprise 功能,仅凭协议提供。

Cerebras Code 套餐

Cerebras Code Pro 标价 $50,每天最多 2400 万 token,面向独立开发者和周末项目。Cerebras Code Max 标价 $200,每天最多 1.2 亿 token,面向全职开发和多智能体系统。按 2026 年 10 月 4 日的抓取,两个付费套餐均标为售罄,本页核查的套餐卡片也未注明计费周期。

Training Cloud

Training Cloud 有两种售卖方式:按小时,由 Cerebras 评估所提交工作负载需要的时长;或按模型,由 Cerebras 专家基于你的数据集设计并微调模型。Training Cloud 页面列出这些选项,但未标价格。

Cerebras 替代方案

其他厂商同样打造定制芯片来做快速推理,而不是租用标准 GPU:

  • Groq:Groq 自称是基于自家 LPU 的快速推理新型云(neocloud),LPU 现已通过 LPX 与 NVIDIA GPU 协同工作。
  • SambaNova SambaCloud:SambaNova 称其 RDU 芯片让 SambaCloud 能在最大的模型上提供快速推理。SambaCloud 支持 DeepSeek、Llama 和 Qwen 等开源模型系列。

与它们相比,Cerebras 的突出之处在于晶圆级处理器、附带 $5 自助试用的 OpenAI 兼容 API,以及可在本地部署 CS-4 系统;不过其自助模型目录仅有两个模型。

注意事项

速率限制与上下文窗口

  • 免费试用期间,每个 Shared Inference 模型的上限为每分钟 5 次请求、每分钟 3 万个未缓存 token、每分钟 9 万个总 token,以及每小时和每天各 100 万 token;qwen-3.8-27b 每次请求可接受 2 张图片,载荷不超过 10 MiB。
  • Developer 层级下,gpt-oss-120b 允许每分钟 100 万个未缓存 token 和每分钟 1000 次请求;qwen-3.8-27b 允许每分钟 15 万个未缓存 token 和每分钟 300 次请求,其总量限制已从 45 万临时上调至 75 万。
  • 限制按组织而非按用户计算,并因模型而异。
  • 容量按令牌桶算法持续补充,而不是按固定周期重置;429 错误会说明超出的是未缓存 token 限制还是总 token 限制。
  • 缓存 token 不计入未缓存限制,总量限制默认是未缓存限制的三倍,因此缓存命中率直接影响吞吐量。

用户反馈也指向同一方向。在一场关于 Cerebras 上线 Qwen 3.8 27B 的公开开发者讨论中,几位开发者表示,Cerebras 允许的 128k 上下文对长时间的智能体或编程任务来说太小。同一讨论串中另有人表示,公共端点 15 万 TPM 的限制让该模型难以用于许多编程任务。一篇 2025 年 9 月的 IT 媒体评论专栏(撰写时 Cerebras Code 运行的是 Qwen3 Coder)报道,生成先飞快地持续 10 到 20 秒,随后每分钟 token 上限触发 429 错误,直到该分钟重置。

模型目录变动与预览功能

  • 自 2026 年 9 月 3 日起,gemma-4-31b 不再在 Shared Inference 上提供,但仍可在 Dedicated Inference 上使用。
  • 弃用日志将 zai-glm-4.7 列为于 2026-08-17 弃用,而 Cerebras Code 页面仍在宣传 GLM 4.7,两个官方页面并不一致。
  • Batch 处于 Private Preview 阶段且不支持 SDK,因此批处理任务需通过 cURL 或直接 HTTP 请求提交。
  • Shared Inference 不提供用于请求优先级排序的服务层级。

API 兼容性差异

  • 仅支持 n: 1;图片必须以 base64 PNG 或 JPEG data URI 发送,因为不支持外部 HTTPS 图片 URL。
  • gpt-oss-120b 会拒绝同时使用 tools 与 response_format 的请求。
  • 图片中嵌入的文字会进入提示词上下文,因此当提示词要求根据图片作答时,带有对抗性指令的图片可能导致模型照做。

性能说法

Cerebras 称其性能对比基于第三方基准测试或内部测试,相较 GPU 系统观察到的速度提升可能因工作负载、配置、日期和模型而异。

隐私、数据使用与条款

  • 隐私政策称,Cerebras 不保留其训练、推理和聊天机器人服务的输入与输出,并在相关日志不再为提供服务所需时将其删除。
  • Cerebras 声明 Playground 和 API 请求绝不会用于训练模型。
  • 另外,Batch 文档称批处理结果在完成后保留 7 天,随后自动删除。
  • Trust Center 在合规项下列出 SOC 2 Type 2、GDPR 和 CCPA,安全文档可应要求提供。
  • 对于 API 使用,模型输出的所有权受第三方模型条款约束,Cerebras 不主张对其拥有所有权。
  • 账户要求用户年满 13 岁或达到所在国家的数字同意最低年龄。
  • Cloud Console 不提供自助删除账户功能,删除请求需提交给支持团队。

FAQ

Q1. $5 试用额度用完后会怎样?

API 和 Playground 访问会停止,但 API 密钥、项目和设置保持不变;一次按量付费购买即可在 Developer 层级重新激活访问,该层级没有每小时或每天的 token 上限。

Q2. Cerebras 会在现有模型 ID 背后更换模型吗?

Cerebras 称其为现有模型 ID 提供未经修改的原始权重,今后如有剪枝变体,会以单独的模型 ID 发布。

Q3. OpenAI SDK 能用于 Dedicated Inference 吗?

可以。OpenAI 兼容的 model 字段在 Shared Inference 上填写确切的模型 ID,在 Dedicated Inference 上填写你的稳定端点 ID,后者会把每个请求路由到其当前活跃的部署。

发现类似工具?
如果你知道其他优秀的AI工具,欢迎提交给我们