Groq 是一家 AI 推理云服务商——你把请求发给它,而不是登录进去和它聊天。官网自述为「面向快速推理的领先 neocloud」,把基础设施、推理与控制整合进同一个平台。它整个产品叙事都建立在一个区分之上:训练产出模型,而推理是模型每一次被真正使用时发生的事。官网把这句话说得很直白——训练创造可能性,推理创造价值。每一次客服应答、每一个智能体任务的完成、每一次代码审查,本质上都是一次推理调用;产品越依赖 AI,这次调用就越容易成为瓶颈。
Groq 在云服务商里的特殊之处在于,它是从芯片层做起的。公司首创了 LPU——一种专为运行已训练模型而非训练模型设计的处理器——如今把这套硬件与 NVIDIA 加速计算并行运营为一朵全球生产级云。而对开发者来说,这一切都藏在一个 HTTPS 端点后面:把 OpenAI SDK 的 base_url 指向 https://api.groq.com/openai/v1,换掉 API key,原有代码就跑在 Groq 上了。计费按消耗的 token 计算,不按席位也不按月。
它提供的模型目录是刻意开放的。Groq 不托管闭源前沿模型,而是以闭源 API 通常达不到的速度提供开放权重模型——GPT-OSS、Qwen、Whisper,以及历史上的 Llama 系列。这个取舍是理解这款产品最关键的一点:你放弃了对市面上最强闭源模型的访问,换来了延迟、吞吐与价格的可预测性。当响应速度本身就是产品特性时,Groq 非常合适;当你需要不计等待时间也要用上最强模型时,它就不是正确选择。
基于 LPU 的推理硬件:LPU(语言处理单元)是 Groq 自研的芯片,为推理而非训练设计。官网公布的机架级指标为每机架 256 颗 LPU、40 PB/s 的 SRAM 带宽、每机架 128 GB 片上 SRAM,以及 315 PFLOPS 的 FP8 推理算力,单用户吞吐标称 1,000 tokens/秒。其架构赌注在于:把模型权重放在高速片上内存里,而不是从外部显存流式读取,才能突破 GPU 服务遇到的延迟下限。
OpenAI 兼容 API:迁移被刻意做得极其简单。改 base URL、改 key,继续用你原有的 OpenAI 客户端库,应用就跑在另一套硬件上了。Groq 同时提供官方 Python 与 TypeScript SDK。正是这一个设计决策,让 Groq 频繁出现在原本基于 OpenAI 编写的项目里,作为一次「换个地址就提速」的升级。
开放权重模型目录:生产级目录以开放权重模型为核心——文本侧是 openai/gpt-oss-120b 与 openai/gpt-oss-20b,语音侧是 whisper-large-v3 与 whisper-large-v3-turbo。预览位则放更新或更专门的模型:Qwen3.6 27B、用于内容审核的 GPT-OSS Safeguard、用于注入检测的 Llama Prompt Guard,以及 Orpheus 语音合成。文档里每个模型都标注了速度、单价、速率限制、上下文窗口与最大补全长度,写代码之前就能把成本算清楚。
Compound:模型加内置工具:除了裸模型端点,Groq 还提供「系统」。Groq Compound 是一套由开放模型驱动的 AI 系统,会有选择地调用内置工具(含网页搜索与代码执行)来回答查询。Compound 与 Compound Mini 速度约 450 tokens/秒,上下文窗口 131,072 token,让你不必自己搭工具调用循环就能获得智能体行为。
语音转写是独立产品线:Whisper 在这里不是附属功能。它有独立计价单位(按音频小时而非 token)、独立的限流维度(每小时与每天的音频秒数)、100 MB 的文件上限,以及专用的转写与翻译端点。做会议纪要、通话分析或字幕管线的团队,可以只在音频环节用 Groq,而不必把文本生成也迁过来。
面向不同可靠性需求的服务层级:一个 service_tier 参数决定请求如何被调度。on_demand 是默认值,提供 Groq 常规速度,高峰期偶有排队;flex 用可靠性换取上限——十倍速率限制、同样价格、尽力而为;performance 是面向延迟敏感生产环境的企业层;auto 则自动选择当下对你可用的最佳层级。
企业控制与专属算力:平台按三层堆叠销售。GroqMetal 提供专属裸金属基础设施,GroqCore 在其上叠加经过验证的推理栈,GroqAssured 再叠加企业级治理、可审计性与控制,每层都包含其下各层。这个结构让企业可以先从共享 API 起步,之后迁到专属算力而无需改动集成方式。
全球部署:Groq 在四大洲运营 13 个数据中心,从 Liberty Lake、Dallas 到 Vantaa、悉尼、伦敦与利雅得,另有加拿大与沙特站点。对延迟敏感的应用来说,与用户的物理距离和芯片速度同样重要。
实时对话界面:当用户正盯着文字逐个蹦出来时,每秒 50 token 和每秒 500 token 的区别,就是「等待」和「阅读」的区别。客服助手、产品内嵌副驾与语音智能体是最直接的适配场景,因为感知上的响应速度就是产品力本身。一种常见做法是:用 Groq 上的快速小模型处理九成简单查询,把剩下的升级路由给更强但更慢的模型。
智能体循环与工具调用链:一个「规划—调用工具—读结果—再规划」的智能体,会把延迟乘以步数。五步链路每步两秒是十秒等待,同样链路每步 300 毫秒则近乎瞬时。这是快速推理复利效应最明显的地方,也是 Groq 常被用在编码智能体与工作流自动化底层、而非单次生成场景的原因。
批量文本处理与分类:给积压文档做摘要、给工单打标签、从上万条记录里抽取结构化字段——这类活儿在意的是吞吐与单位成本,而非单次延迟。flex 层正是为这种形态设计的:十倍标准限额、同样的按 token 单价;能容忍延迟窗口的任务还可以走批处理。
转写与音频管线:Groq 上的 Whisper 可处理会议录音、播客存档、呼叫中心音频与字幕生成,按音频小时而非 token 计价。由于转写与文本生成共用同一套 API 和同一把密钥,一条「先转写通话、再生成摘要」的管线只需要维护一家供应商关系。
原型验证与成本可控的试验:免费额度无需信用卡即可访问模型目录(限额较低),因此 Groq 常成为黑客松项目、业余项目与内部演示的第一站。绑定支付方式即可提升限额,且不必承诺订阅,评估平台的成本被实际用量所限定。
迁移既有的 OpenAI 应用:因为 API 在客户端库层面兼容,团队常把 Groq 当作对照基准而非直接承诺——用两行配置改动,把同一批提示词分别打到两家,对比延迟、成本与输出质量。有些负载会永久迁移,有些则按任务类型长期分流。
在 Groq Console 注册账号。 完成邮箱验证后你会进入一个组织(organisation)——这一点很重要,因为配额是按组织统计的,不是按用户。
生成 API key。 在控制台创建密钥,并存为环境变量(如 GROQ_API_KEY)。切勿提交进代码仓库;这把密钥授权的是你组织账户上的实际花费。
把客户端指向 Groq。 如果你已在用 OpenAI SDK,把 base_url 设为 https://api.groq.com/openai/v1,api_key 传入 Groq 密钥即可。如果是全新开始,安装官方 groq(Python)或 groq-sdk(TypeScript)。第一个请求就是一次普通的 chat completion 调用,模型 ID 可用 openai/gpt-oss-20b。
为任务挑对模型。 定型之前先读一遍支持模型页:它列出了每个模型的每秒 token 速度、每百万 token 单价、速率限制、上下文窗口与最大补全 token 数。准备上线的东西一律优先选生产模型——预览模型是给评估用的,可能在极短通知期内下线。
设置服务层级并处理限流。 想要默认的按需行为就不传 service_tier;转为付费计划后,高吞吐的批量型任务可设为 flex。读取 x-ratelimit-remaining-tokens 与 x-ratelimit-remaining-requests 响应头,并对 HTTP 429(以及 flex 的 HTTP 498)实现带抖动的退避重试。
扩量之前先加上账单控制。 绑定支付方式以解除免费额度上限,然后在控制台设置支出上限与用量告警。上线第一周务必在 Dashboard → Usage 盯紧消耗——那正是预估最不准的阶段。
按任务选模型,别默认用最大的那个。 在 Groq 上,小模型明显更快也更便宜;对于分类、抽取、路由与短文本生成,质量差距往往用户根本感知不到。在假定自己需要大模型之前,先用你自己的提示词把 gpt-oss-20b 和 gpt-oss-120b 跑一遍对比——两者速度差距大致是两倍。
从第一天就为模型弃用做设计。 Groq 的目录更替很快。把模型 ID 放进配置而不是硬编码,留意弃用页面,并确保账号邮箱是有人会真的去处理迁移通知的地址。如果你的代码不能快速重新部署,一个消失的模型 ID 就是一次故障。
别指望靠多开 API key 买到额度。 速率限制按组织而非按用户或按密钥计算,多签发密钥不会提高你的天花板。需要更多吞吐,就绑支付方式、转 flex 层,或者联系销售谈专属算力。
把首字延迟与总延迟分开监控。 Groq 的优势在两者上都体现,但它们的病因不同:首字慢通常意味着排队或区域距离过远,补全慢则通常意味着模型生成了超出你需要的内容。把 max_tokens 卡紧一些——在任何硬件上,更短的答案都更快。
用好提示缓存,保持系统提示词稳定。 缓存 token 不计入速率限制,所以跨请求保持稳定的系统提示词既降成本又变相买到吞吐。每次调用都重写系统提示词,等于把这份收益扔掉。
重试要做对,flex 层尤其如此。 flex 层被明确定义为尽力而为:容量失败是预期内的、会快速返回、且可以安全重试。在那里带抖动的指数退避不是可选项。把 HTTP 498 当成「稍后再试」,而不是要抛给用户的错误。
发送敏感数据之前先打开零数据留存。 ZDR 对所有客户开放,但不是默认状态,而且启用它同时会禁用依赖持久化的功能。这个取舍要在第一个生产请求之前决定,而不是之后。
保留一条切换到其他服务商的通路。 由于 API 在两个方向上都与 OpenAI 兼容,在同一接口后面多配一家服务商成本很低,却能让你在容量事件、模型弃用与调价面前留有余地。
构建延迟敏感 AI 功能的应用开发者:只要你的用户在盯着文字出现——聊天界面、副驾、语音产品——收益就最直接,因为速度会直接转化为感知上的质量。
构建智能体与多步工作流的团队:当延迟随步数相乘时,快速推理的价值远高于单次请求基准所显示的。智能体框架、编码助手与自动化管线是天然适配对象。
已经投入 OpenAI SDK 的工程师:如果你的代码库是照着 OpenAI 客户端库写的,评估 Groq 只需改配置而非重写。这种极低的切换成本是该平台最有效的获客通道。
跑大量简单任务、对成本敏感的团队:规模化的分类、打标、抽取与摘要,跑在开放权重小模型上远比跑在闭源前沿模型上便宜,而 Groq 的按 token 计价让这笔账很好算。
创业公司与做原型的人:免费额度无需信用卡、按量付费无订阅门槛,让这个平台既容易上手也容易放弃——这恰恰是早期团队想要的。
有延迟、治理或数据驻留要求的企业:GroqAssured、performance 服务层、零数据留存与专属裸金属算力,正是为那些不能跑在共享尽力而为端点上的组织准备的。
做音频与转写产品的团队:按音频小时计价的 Whisper、独立的音频限流维度与翻译端点,让 Groq 可以单独作为转写供应商使用,与你是否用它做文本生成无关。
https://api.groq.com/openai/v1,覆盖 chat completions、Responses API、音频转写、翻译与语音合成、批处理、文件与微调端点。console.groq.com 提供账号管理、API 密钥、项目、模型权限、用量看板、支出上限与数据控制,以及完整文档与 API 参考。免费额度。 Groq 提供无需信用卡的免费开发者层,可在较低速率限制下访问模型目录。它对原型验证、业余项目、内部演示与低流量功能是真正可用的,通常最先撞到的上限是每日请求数而非 token 数。结构上要注意的一点是:限额按组织统计,所以免费账户无法靠多建密钥来扩容。
按量付费。 API 访问没有订阅费。文本模型按每百万 token 计价,输入与输出分别定价——例如 gpt-oss-120b 为输入 0.15 美元、输出 0.60 美元每百万 token,gpt-oss-20b 为 0.075 与 0.30;语音转写按音频小时计费,whisper-large-v3 为每小时 0.111 美元,turbo 版本为 0.04 美元。绑定支付方式会大幅提升速率限制,并解锁 flex 与批处理层——两者在同样的按 token 单价下提供更高吞吐。第三方基准平台 Artificial Analysis 实测的混合价区间约为每百万 token 0.05 至 0.84 美元,跨模型价差约十六倍。
账单机制。 扣款先渐进后月结:累计用量首次跨过 1、10、100、500、1,000 美元这几个阈值时会立即扣款,之后转为纯月度出账,印度客户适用不同的阈值节奏。低于 0.50 美元不出账。控制台可配置支出上限与预算告警,用量近实时可见。
企业方案。 承诺消费合同、performance 服务层、专属 GroqMetal 算力与 GroqAssured 治理层通过销售渠道而非自助购买。企业合同还有一项容易被忽略的实际好处:适用于免费与开发者层的模型弃用,对签有承诺消费合同的客户豁免。由于目录与价格变动频繁,具体条款与当期费率请以官网文档与控制台最新页面为准。
模型目录更替非常激进。 这是最实际的风险。Groq 自家的弃用页面记录了一连串下线:llama-3.1-8b-instant 与 llama-3.3-70b-versatile 于 2026 年 8 月 16 日一同退役,qwen3-32b 与 llama-4-scout 早一个月被移除,此前还有 Kimi K2 与 Llama 4 Maverick。弃用适用于免费与开发者层,而签有承诺消费合同的企业客户获得豁免——这意味着保护最少的用户承担了最多的更替成本。预览模型更带有「可能在极短通知期内下线」的明确警告。
OpenAI 兼容是接近而非完全。 若干在面向 OpenAI 的代码中常见的参数会直接失败:logprobs、logit_bias、top_logprobs 与 messages[].name 均返回 400 错误,n 必须为 1。音频转写不输出 vtt 与 srt,temperature 设为 0 会被静默改写为 1e-8。常见路径迁移很轻松,边角仍可能翻车,所以要实测而非假定。
能力上限受制于开放权重目录。 速度是真的,但那是中等规模开放模型上的速度。在 Artificial Analysis 的独立基准中,其追踪的 11 个 Groq 模型里智能指数最高的是 Qwen3.6 27B,得分 38——明显低于闭源前沿模型。面对最难的推理、长周期编码或讲究分寸的写作任务,更慢的前沿模型仍可能产出更好的结果。
速率限制是组织级且多维度的。 每分钟请求数、每日请求数、每分钟 token、每日 token 与音频秒数同时生效,哪一维先触顶就被哪一维限住——大量微小请求的调用模式可能在几乎没用掉 token 额度的情况下先耗尽 RPM。部分组织还另有输入与输出 token 的分离限制。
flex 层被明确定义为尽力而为。 它以同样的价格提供十倍速率限制,但容量不足时请求会以 HTTP 498 与 capacity_exceeded 错误失败。这是刻意的设计而非缺陷,也因此 flex 在没有兜底方案时不适合放在面向用户的路径上。
数据驻留固定在美国。 尽管推理请求默认不留存、且所有客户都可启用零数据留存,但任何被留存的数据都位于美国境内的 Google Cloud Platform 存储桶中,跨境传输在适用情形下依赖标准合同条款。有严格欧盟或亚太驻留要求的组织应对照自身合规义务确认;另需注意启用 ZDR 会同时禁用依赖持久化的功能,如批处理任务与微调。
公司层面近期经历过动荡。 2025 年 12 月,DataCenterDynamics 报道创始人 Jonathan Ross 与总裁 Sunny Madra 在一项非独占技术授权协议下加入 NVIDIA,Groq 则由 Simon Edwards 接任 CEO 继续独立经营,GroqCloud 不中断运行。关于交易金额的报道口径并不稳定:被广泛引用的 200 亿美元数字未经独立核实,非独占授权的条款也从未披露。2026 年 8 月的 A 轮给出 35 亿美元估值,约为 2025 年 9 月融资时 69 亿美元估值的一半。服务连续性始终得到保持,但要做多年期基础设施承诺的团队,应把所有权与领导层变动与技术本身一并权衡。
独立用户评价数据很薄。 Groq 的媒体覆盖量很大,结构化的评测平台反馈却极少——G2 条目上的评论数微不足道,第三方导航站把 Groq 归入 AI API、大语言模型与开源 AI 模型类目而非消费级聊天工具,同样没有有意义的评论量。目前可得的最强独立证据是基准数据而非用户证言,因此关于客服质量或长期可靠性的说法都应视为未经验证。
不要与 Grok 混淆。 Groq(groq.com)是 Groq LLC 的推理基础设施;Grok(grok.com)是 Elon Musk 旗下 xAI 的消费级聊天助手。两个名字只差一个字母的位置,产品则毫无共同之处——不同公司、不同受众、不同商业模式。
可以。平台提供无需信用卡的免费开发者层,能在较低速率限制下访问模型目录,足以支撑原型验证与低流量项目。绑定支付方式会大幅提升限额并解锁 flex 与批处理层;平台没有订阅费,只有按 token 的用量费用。
它们是毫无关联的两个产品,只因拼写极为相近而经常被混淆。Groq(groq.com)是建立在 LPU 硬件之上、以 API 形式卖给开发者的 AI 推理云;Grok(grok.com)是 xAI 的消费级聊天助手。不同公司、不同产品、不同定价模式。
多数情况下可以,只需两处改动:把 base URL 设为 https://api.groq.com/openai/v1,并传入 Groq API key。有几个参数不受支持并会返回 400 错误——logprobs、logit_bias、top_logprobs 与 messages[].name——且 n 必须为 1,所以请实测你自己的调用模式,别假定一定能干净切换。
Groq 提供的是开放权重模型而非闭源前沿模型。生产目录以文本侧的 openai/gpt-oss-120b、openai/gpt-oss-20b 与语音侧的 whisper-large-v3 及其 turbo 版本为核心,预览位则放 Qwen3.6 27B、安全分类模型与 Orpheus 语音合成等。当前清单始终可从模型文档与 /openai/v1/models 端点获取。
第三方基准平台 Artificial Analysis 实测:Groq 上最快的模型是高推理档的 gpt-oss-20b,中位速度 949 tokens/秒,最低首 token 时间约 0.77 秒。Groq 自报的硬件指标为单用户最高 1,000 tokens/秒。实际吞吐会随模型、提示长度、服务层级与负载而变化。
Groq 声明推理请求的客户数据默认不留存。仅在需要持久化才能工作的功能(如批处理与微调),或为排查可靠性问题与调查滥用时才会留存,后者最长保留 30 天。所有客户均可启用零数据留存,但启用后依赖持久化的功能会被停用。
推理运行在四大洲的 13 个数据中心,但任何被留存的客户数据都存放在位于美国的 Google Cloud Platform 存储桶中,跨境传输在适用情形下依赖标准合同条款。有严格地域驻留要求的组织应对照自身合规规则核实。
不能。速率限制按组织生效,额外的密钥共享同一份配额。想要更多余量,可以绑定支付方式转入开发者层限额、对高吞吐任务使用 flex 层,或通过销售渠道安排专属算力。
文本模型按 token 计费,转写按音频小时计费,没有订阅成分。扣款起初是渐进式的:累计用量跨过 1、10、100、500 与 1,000 美元时出账,此后转为纯月结。低于 0.50 美元不出账,控制台可配置支出上限与预算告警。
GroqCloud 在多次重大公司变动中(NVIDIA 授权协议、创始人离开、领导层更替)持续运行未中断,公司也于 2026 年 8 月以 35 亿美元估值完成 3.5 亿美元 A 轮。实际风险与其说是公司消失,不如说是模型更替:请把模型 ID 做成可配置项、盯住弃用通知,并在同一接口后面保留第二家服务商。