Toolso.AI
Toolso.AI
所有工具分类热门榜单最新工具价格博客
Toolso.AI
Toolso.AI

💌订阅 AI 工具周报

每周精选最新、最热门的AI工具和行业动态,直达您的邮箱 订阅

Toolso.AI
Toolso.AI

发现最好的AI工具,提升你的工作效率

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

热门分类

  • AI写作
  • AI图像
  • AI视频
  • AI编程
  • 更多分类

探索发现

  • 最新收录
  • 热门推荐
  • 更多工具
  • 提交工具
  • 价格

关于

  • 关于我们
  • 联系我们
  • 博客
  • 更新日志

法律

  • Cookie政策
  • 隐私政策
  • 服务条款
  • 退款政策
© 2026 Toolso.AI 保留所有权利
限时推广限时推广$29.90到期后 $59.9010月31日后涨价至 $59.90距结束--:--:--立即提交
  1. 首页
  2. 所有工具
  3. 开发工具
  4. Groq
Groq界面预览
Groq标志

Groq

Groq 用自研 LPU 硬件与 NVIDIA 集群运行开放权重的语言、语音与推理模型,通过 OpenAI 兼容 API 对外提供服务,按 token 计费、设有免费开发者额度,全球部署 13 个数据中心。

开发工具模型中心生成式 AI 平台#企业版#API#实时
免费试用
收藏
访问次数
浏览次数
定价
免费增值
发布日期
2026年8月22日
域名
groq.com
用户评分

用过这个工具吗?给它评分

为这个工具评分

Groq 工具信息

免费试用
工具信息
收藏
访问次数
浏览次数
定价
免费增值
发布日期
2026年8月22日
域名
groq.com
用户评分

用过这个工具吗?给它评分

为这个工具评分

推荐工具

相关工具推荐

免费试用

Groq 是什么?

Groq 是一家 AI 推理云服务商——你把请求发给它,而不是登录进去和它聊天。官网自述为「面向快速推理的领先 neocloud」,把基础设施、推理与控制整合进同一个平台。它整个产品叙事都建立在一个区分之上:训练产出模型,而推理是模型每一次被真正使用时发生的事。官网把这句话说得很直白——训练创造可能性,推理创造价值。每一次客服应答、每一个智能体任务的完成、每一次代码审查,本质上都是一次推理调用;产品越依赖 AI,这次调用就越容易成为瓶颈。

Groq 在云服务商里的特殊之处在于,它是从芯片层做起的。公司首创了 LPU——一种专为运行已训练模型而非训练模型设计的处理器——如今把这套硬件与 NVIDIA 加速计算并行运营为一朵全球生产级云。而对开发者来说,这一切都藏在一个 HTTPS 端点后面:把 OpenAI SDK 的 base_url 指向 https://api.groq.com/openai/v1,换掉 API key,原有代码就跑在 Groq 上了。计费按消耗的 token 计算,不按席位也不按月。

它提供的模型目录是刻意开放的。Groq 不托管闭源前沿模型,而是以闭源 API 通常达不到的速度提供开放权重模型——GPT-OSS、Qwen、Whisper,以及历史上的 Llama 系列。这个取舍是理解这款产品最关键的一点:你放弃了对市面上最强闭源模型的访问,换来了延迟、吞吐与价格的可预测性。当响应速度本身就是产品特性时,Groq 非常合适;当你需要不计等待时间也要用上最强模型时,它就不是正确选择。


核心功能

  • 基于 LPU 的推理硬件:LPU(语言处理单元)是 Groq 自研的芯片,为推理而非训练设计。官网公布的机架级指标为每机架 256 颗 LPU、40 PB/s 的 SRAM 带宽、每机架 128 GB 片上 SRAM,以及 315 PFLOPS 的 FP8 推理算力,单用户吞吐标称 1,000 tokens/秒。其架构赌注在于:把模型权重放在高速片上内存里,而不是从外部显存流式读取,才能突破 GPU 服务遇到的延迟下限。

  • OpenAI 兼容 API:迁移被刻意做得极其简单。改 base URL、改 key,继续用你原有的 OpenAI 客户端库,应用就跑在另一套硬件上了。Groq 同时提供官方 Python 与 TypeScript SDK。正是这一个设计决策,让 Groq 频繁出现在原本基于 OpenAI 编写的项目里,作为一次「换个地址就提速」的升级。

  • 开放权重模型目录:生产级目录以开放权重模型为核心——文本侧是 openai/gpt-oss-120b 与 openai/gpt-oss-20b,语音侧是 whisper-large-v3 与 whisper-large-v3-turbo。预览位则放更新或更专门的模型:Qwen3.6 27B、用于内容审核的 GPT-OSS Safeguard、用于注入检测的 Llama Prompt Guard,以及 Orpheus 语音合成。文档里每个模型都标注了速度、单价、速率限制、上下文窗口与最大补全长度,写代码之前就能把成本算清楚。

  • Compound:模型加内置工具:除了裸模型端点,Groq 还提供「系统」。Groq Compound 是一套由开放模型驱动的 AI 系统,会有选择地调用内置工具(含网页搜索与代码执行)来回答查询。Compound 与 Compound Mini 速度约 450 tokens/秒,上下文窗口 131,072 token,让你不必自己搭工具调用循环就能获得智能体行为。

  • 语音转写是独立产品线:Whisper 在这里不是附属功能。它有独立计价单位(按音频小时而非 token)、独立的限流维度(每小时与每天的音频秒数)、100 MB 的文件上限,以及专用的转写与翻译端点。做会议纪要、通话分析或字幕管线的团队,可以只在音频环节用 Groq,而不必把文本生成也迁过来。

  • 面向不同可靠性需求的服务层级:一个 service_tier 参数决定请求如何被调度。on_demand 是默认值,提供 Groq 常规速度,高峰期偶有排队;flex 用可靠性换取上限——十倍速率限制、同样价格、尽力而为;performance 是面向延迟敏感生产环境的企业层;auto 则自动选择当下对你可用的最佳层级。

  • 企业控制与专属算力:平台按三层堆叠销售。GroqMetal 提供专属裸金属基础设施,GroqCore 在其上叠加经过验证的推理栈,GroqAssured 再叠加企业级治理、可审计性与控制,每层都包含其下各层。这个结构让企业可以先从共享 API 起步,之后迁到专属算力而无需改动集成方式。

  • 全球部署:Groq 在四大洲运营 13 个数据中心,从 Liberty Lake、Dallas 到 Vantaa、悉尼、伦敦与利雅得,另有加拿大与沙特站点。对延迟敏感的应用来说,与用户的物理距离和芯片速度同样重要。


使用场景

  1. 实时对话界面:当用户正盯着文字逐个蹦出来时,每秒 50 token 和每秒 500 token 的区别,就是「等待」和「阅读」的区别。客服助手、产品内嵌副驾与语音智能体是最直接的适配场景,因为感知上的响应速度就是产品力本身。一种常见做法是:用 Groq 上的快速小模型处理九成简单查询,把剩下的升级路由给更强但更慢的模型。

  2. 智能体循环与工具调用链:一个「规划—调用工具—读结果—再规划」的智能体,会把延迟乘以步数。五步链路每步两秒是十秒等待,同样链路每步 300 毫秒则近乎瞬时。这是快速推理复利效应最明显的地方,也是 Groq 常被用在编码智能体与工作流自动化底层、而非单次生成场景的原因。

  3. 批量文本处理与分类:给积压文档做摘要、给工单打标签、从上万条记录里抽取结构化字段——这类活儿在意的是吞吐与单位成本,而非单次延迟。flex 层正是为这种形态设计的:十倍标准限额、同样的按 token 单价;能容忍延迟窗口的任务还可以走批处理。

  4. 转写与音频管线:Groq 上的 Whisper 可处理会议录音、播客存档、呼叫中心音频与字幕生成,按音频小时而非 token 计价。由于转写与文本生成共用同一套 API 和同一把密钥,一条「先转写通话、再生成摘要」的管线只需要维护一家供应商关系。

  5. 原型验证与成本可控的试验:免费额度无需信用卡即可访问模型目录(限额较低),因此 Groq 常成为黑客松项目、业余项目与内部演示的第一站。绑定支付方式即可提升限额,且不必承诺订阅,评估平台的成本被实际用量所限定。

  6. 迁移既有的 OpenAI 应用:因为 API 在客户端库层面兼容,团队常把 Groq 当作对照基准而非直接承诺——用两行配置改动,把同一批提示词分别打到两家,对比延迟、成本与输出质量。有些负载会永久迁移,有些则按任务类型长期分流。


如何使用 Groq

  1. 在 Groq Console 注册账号。 完成邮箱验证后你会进入一个组织(organisation)——这一点很重要,因为配额是按组织统计的,不是按用户。

  2. 生成 API key。 在控制台创建密钥,并存为环境变量(如 GROQ_API_KEY)。切勿提交进代码仓库;这把密钥授权的是你组织账户上的实际花费。

  3. 把客户端指向 Groq。 如果你已在用 OpenAI SDK,把 base_url 设为 https://api.groq.com/openai/v1,api_key 传入 Groq 密钥即可。如果是全新开始,安装官方 groq(Python)或 groq-sdk(TypeScript)。第一个请求就是一次普通的 chat completion 调用,模型 ID 可用 openai/gpt-oss-20b。

  4. 为任务挑对模型。 定型之前先读一遍支持模型页:它列出了每个模型的每秒 token 速度、每百万 token 单价、速率限制、上下文窗口与最大补全 token 数。准备上线的东西一律优先选生产模型——预览模型是给评估用的,可能在极短通知期内下线。

  5. 设置服务层级并处理限流。 想要默认的按需行为就不传 service_tier;转为付费计划后,高吞吐的批量型任务可设为 flex。读取 x-ratelimit-remaining-tokens 与 x-ratelimit-remaining-requests 响应头,并对 HTTP 429(以及 flex 的 HTTP 498)实现带抖动的退避重试。

  6. 扩量之前先加上账单控制。 绑定支付方式以解除免费额度上限,然后在控制台设置支出上限与用量告警。上线第一周务必在 Dashboard → Usage 盯紧消耗——那正是预估最不准的阶段。


使用技巧与最佳实践

  • 按任务选模型,别默认用最大的那个。 在 Groq 上,小模型明显更快也更便宜;对于分类、抽取、路由与短文本生成,质量差距往往用户根本感知不到。在假定自己需要大模型之前,先用你自己的提示词把 gpt-oss-20b 和 gpt-oss-120b 跑一遍对比——两者速度差距大致是两倍。

  • 从第一天就为模型弃用做设计。 Groq 的目录更替很快。把模型 ID 放进配置而不是硬编码,留意弃用页面,并确保账号邮箱是有人会真的去处理迁移通知的地址。如果你的代码不能快速重新部署,一个消失的模型 ID 就是一次故障。

  • 别指望靠多开 API key 买到额度。 速率限制按组织而非按用户或按密钥计算,多签发密钥不会提高你的天花板。需要更多吞吐,就绑支付方式、转 flex 层,或者联系销售谈专属算力。

  • 把首字延迟与总延迟分开监控。 Groq 的优势在两者上都体现,但它们的病因不同:首字慢通常意味着排队或区域距离过远,补全慢则通常意味着模型生成了超出你需要的内容。把 max_tokens 卡紧一些——在任何硬件上,更短的答案都更快。

  • 用好提示缓存,保持系统提示词稳定。 缓存 token 不计入速率限制,所以跨请求保持稳定的系统提示词既降成本又变相买到吞吐。每次调用都重写系统提示词,等于把这份收益扔掉。

  • 重试要做对,flex 层尤其如此。 flex 层被明确定义为尽力而为:容量失败是预期内的、会快速返回、且可以安全重试。在那里带抖动的指数退避不是可选项。把 HTTP 498 当成「稍后再试」,而不是要抛给用户的错误。

  • 发送敏感数据之前先打开零数据留存。 ZDR 对所有客户开放,但不是默认状态,而且启用它同时会禁用依赖持久化的功能。这个取舍要在第一个生产请求之前决定,而不是之后。

  • 保留一条切换到其他服务商的通路。 由于 API 在两个方向上都与 OpenAI 兼容,在同一接口后面多配一家服务商成本很低,却能让你在容量事件、模型弃用与调价面前留有余地。


适用人群

  • 构建延迟敏感 AI 功能的应用开发者:只要你的用户在盯着文字出现——聊天界面、副驾、语音产品——收益就最直接,因为速度会直接转化为感知上的质量。

  • 构建智能体与多步工作流的团队:当延迟随步数相乘时,快速推理的价值远高于单次请求基准所显示的。智能体框架、编码助手与自动化管线是天然适配对象。

  • 已经投入 OpenAI SDK 的工程师:如果你的代码库是照着 OpenAI 客户端库写的,评估 Groq 只需改配置而非重写。这种极低的切换成本是该平台最有效的获客通道。

  • 跑大量简单任务、对成本敏感的团队:规模化的分类、打标、抽取与摘要,跑在开放权重小模型上远比跑在闭源前沿模型上便宜,而 Groq 的按 token 计价让这笔账很好算。

  • 创业公司与做原型的人:免费额度无需信用卡、按量付费无订阅门槛,让这个平台既容易上手也容易放弃——这恰恰是早期团队想要的。

  • 有延迟、治理或数据驻留要求的企业:GroqAssured、performance 服务层、零数据留存与专属裸金属算力,正是为那些不能跑在共享尽力而为端点上的组织准备的。

  • 做音频与转写产品的团队:按音频小时计价的 Whisper、独立的音频限流维度与翻译端点,让 Groq 可以单独作为转写供应商使用,与你是否用它做文本生成无关。


支持平台

  • REST API:主要接口,地址为 https://api.groq.com/openai/v1,覆盖 chat completions、Responses API、音频转写、翻译与语音合成、批处理、文件与微调端点。
  • 官方 SDK:官方 Python 与 TypeScript 库,同时兼容 OpenAI 自家的两种语言客户端库。
  • 网页控制台:console.groq.com 提供账号管理、API 密钥、项目、模型权限、用量看板、支出上限与数据控制,以及完整文档与 API 参考。
  • 编码工具集成:文档中含多款智能体编码工具的接入指南,并提供远程工具与 MCP 连接器供智能体框架使用。
  • 专属与本地部署算力:GroqMetal 为需要隔离而非共享端点的组织提供专属裸金属基础设施。
  • 没有面向消费者的移动 App:Groq 是开发者基础设施,不提供 iOS 或 Android 客户端——产品是被你的应用消费的,而非被终端用户直接使用。

价格与套餐

免费额度。 Groq 提供无需信用卡的免费开发者层,可在较低速率限制下访问模型目录。它对原型验证、业余项目、内部演示与低流量功能是真正可用的,通常最先撞到的上限是每日请求数而非 token 数。结构上要注意的一点是:限额按组织统计,所以免费账户无法靠多建密钥来扩容。

按量付费。 API 访问没有订阅费。文本模型按每百万 token 计价,输入与输出分别定价——例如 gpt-oss-120b 为输入 0.15 美元、输出 0.60 美元每百万 token,gpt-oss-20b 为 0.075 与 0.30;语音转写按音频小时计费,whisper-large-v3 为每小时 0.111 美元,turbo 版本为 0.04 美元。绑定支付方式会大幅提升速率限制,并解锁 flex 与批处理层——两者在同样的按 token 单价下提供更高吞吐。第三方基准平台 Artificial Analysis 实测的混合价区间约为每百万 token 0.05 至 0.84 美元,跨模型价差约十六倍。

账单机制。 扣款先渐进后月结:累计用量首次跨过 1、10、100、500、1,000 美元这几个阈值时会立即扣款,之后转为纯月度出账,印度客户适用不同的阈值节奏。低于 0.50 美元不出账。控制台可配置支出上限与预算告警,用量近实时可见。

企业方案。 承诺消费合同、performance 服务层、专属 GroqMetal 算力与 GroqAssured 治理层通过销售渠道而非自助购买。企业合同还有一项容易被忽略的实际好处:适用于免费与开发者层的模型弃用,对签有承诺消费合同的客户豁免。由于目录与价格变动频繁,具体条款与当期费率请以官网文档与控制台最新页面为准。


替代方案

  • Together AI:定位接近的开放模型推理服务商,目录更广(含图像模型与微调),主要在模型广度而非纯延迟上竞争。
  • Fireworks AI:另一家开放权重推理平台,侧重生产化服务与微调模型部署,常被希望托管自有适配器的团队选用。
  • Cerebras:同样以自研芯片在推理速度上竞争的挑战者,在延迟基准上与 Groq 正面对位。
  • OpenRouter:聚合者而非运营者——它在一个 API 后面路由到多家服务商(含闭源前沿模型),适合更看重广度与故障转移而非单一后端极致速度的场景。
  • OpenAI 与 Anthropic API:这是能力维度而非速度维度的对照物。如果你的负载需要市面上最强的推理能力且能承受延迟,闭源前沿模型仍是基准;Groq 的目录是开放权重的,能力上限更低。
  • 自托管 vLLM 或 TensorRT-LLM:在自有 GPU 上跑开放模型,能获得最大控制权与数据驻留自由,代价是自己运维基础设施,且没有可观的工程投入通常达不到 Groq 的延迟水平。

限制与注意事项

  • 模型目录更替非常激进。 这是最实际的风险。Groq 自家的弃用页面记录了一连串下线:llama-3.1-8b-instant 与 llama-3.3-70b-versatile 于 2026 年 8 月 16 日一同退役,qwen3-32b 与 llama-4-scout 早一个月被移除,此前还有 Kimi K2 与 Llama 4 Maverick。弃用适用于免费与开发者层,而签有承诺消费合同的企业客户获得豁免——这意味着保护最少的用户承担了最多的更替成本。预览模型更带有「可能在极短通知期内下线」的明确警告。

  • OpenAI 兼容是接近而非完全。 若干在面向 OpenAI 的代码中常见的参数会直接失败:logprobs、logit_bias、top_logprobs 与 messages[].name 均返回 400 错误,n 必须为 1。音频转写不输出 vtt 与 srt,temperature 设为 0 会被静默改写为 1e-8。常见路径迁移很轻松,边角仍可能翻车,所以要实测而非假定。

  • 能力上限受制于开放权重目录。 速度是真的,但那是中等规模开放模型上的速度。在 Artificial Analysis 的独立基准中,其追踪的 11 个 Groq 模型里智能指数最高的是 Qwen3.6 27B,得分 38——明显低于闭源前沿模型。面对最难的推理、长周期编码或讲究分寸的写作任务,更慢的前沿模型仍可能产出更好的结果。

  • 速率限制是组织级且多维度的。 每分钟请求数、每日请求数、每分钟 token、每日 token 与音频秒数同时生效,哪一维先触顶就被哪一维限住——大量微小请求的调用模式可能在几乎没用掉 token 额度的情况下先耗尽 RPM。部分组织还另有输入与输出 token 的分离限制。

  • flex 层被明确定义为尽力而为。 它以同样的价格提供十倍速率限制,但容量不足时请求会以 HTTP 498 与 capacity_exceeded 错误失败。这是刻意的设计而非缺陷,也因此 flex 在没有兜底方案时不适合放在面向用户的路径上。

  • 数据驻留固定在美国。 尽管推理请求默认不留存、且所有客户都可启用零数据留存,但任何被留存的数据都位于美国境内的 Google Cloud Platform 存储桶中,跨境传输在适用情形下依赖标准合同条款。有严格欧盟或亚太驻留要求的组织应对照自身合规义务确认;另需注意启用 ZDR 会同时禁用依赖持久化的功能,如批处理任务与微调。

  • 公司层面近期经历过动荡。 2025 年 12 月,DataCenterDynamics 报道创始人 Jonathan Ross 与总裁 Sunny Madra 在一项非独占技术授权协议下加入 NVIDIA,Groq 则由 Simon Edwards 接任 CEO 继续独立经营,GroqCloud 不中断运行。关于交易金额的报道口径并不稳定:被广泛引用的 200 亿美元数字未经独立核实,非独占授权的条款也从未披露。2026 年 8 月的 A 轮给出 35 亿美元估值,约为 2025 年 9 月融资时 69 亿美元估值的一半。服务连续性始终得到保持,但要做多年期基础设施承诺的团队,应把所有权与领导层变动与技术本身一并权衡。

  • 独立用户评价数据很薄。 Groq 的媒体覆盖量很大,结构化的评测平台反馈却极少——G2 条目上的评论数微不足道,第三方导航站把 Groq 归入 AI API、大语言模型与开源 AI 模型类目而非消费级聊天工具,同样没有有意义的评论量。目前可得的最强独立证据是基准数据而非用户证言,因此关于客服质量或长期可靠性的说法都应视为未经验证。

  • 不要与 Grok 混淆。 Groq(groq.com)是 Groq LLC 的推理基础设施;Grok(grok.com)是 Elon Musk 旗下 xAI 的消费级聊天助手。两个名字只差一个字母的位置,产品则毫无共同之处——不同公司、不同受众、不同商业模式。


常见问题(FAQ)

Q1. Groq 可以免费使用吗?

可以。平台提供无需信用卡的免费开发者层,能在较低速率限制下访问模型目录,足以支撑原型验证与低流量项目。绑定支付方式会大幅提升限额并解锁 flex 与批处理层;平台没有订阅费,只有按 token 的用量费用。

Q2. Groq 和 Grok 有什么区别?

它们是毫无关联的两个产品,只因拼写极为相近而经常被混淆。Groq(groq.com)是建立在 LPU 硬件之上、以 API 形式卖给开发者的 AI 推理云;Grok(grok.com)是 xAI 的消费级聊天助手。不同公司、不同产品、不同定价模式。

Q3. 我能把现有的 OpenAI 代码迁到 Groq 吗?

多数情况下可以,只需两处改动:把 base URL 设为 https://api.groq.com/openai/v1,并传入 Groq API key。有几个参数不受支持并会返回 400 错误——logprobs、logit_bias、top_logprobs 与 messages[].name——且 n 必须为 1,所以请实测你自己的调用模式,别假定一定能干净切换。

Q4. Groq 上有哪些模型?

Groq 提供的是开放权重模型而非闭源前沿模型。生产目录以文本侧的 openai/gpt-oss-120b、openai/gpt-oss-20b 与语音侧的 whisper-large-v3 及其 turbo 版本为核心,预览位则放 Qwen3.6 27B、安全分类模型与 Orpheus 语音合成等。当前清单始终可从模型文档与 /openai/v1/models 端点获取。

Q5. Groq 实际有多快?

第三方基准平台 Artificial Analysis 实测:Groq 上最快的模型是高推理档的 gpt-oss-20b,中位速度 949 tokens/秒,最低首 token 时间约 0.77 秒。Groq 自报的硬件指标为单用户最高 1,000 tokens/秒。实际吞吐会随模型、提示长度、服务层级与负载而变化。

Q6. 我的数据会被怎么处理?

Groq 声明推理请求的客户数据默认不留存。仅在需要持久化才能工作的功能(如批处理与微调),或为排查可靠性问题与调查滥用时才会留存,后者最长保留 30 天。所有客户均可启用零数据留存,但启用后依赖持久化的功能会被停用。

Q7. 我的数据在哪里处理和存储?

推理运行在四大洲的 13 个数据中心,但任何被留存的客户数据都存放在位于美国的 Google Cloud Platform 存储桶中,跨境传输在适用情形下依赖标准合同条款。有严格地域驻留要求的组织应对照自身合规规则核实。

Q8. 多创建几个 API key 能提高速率限制吗?

不能。速率限制按组织生效,额外的密钥共享同一份配额。想要更多余量,可以绑定支付方式转入开发者层限额、对高吞吐任务使用 flex 层,或通过销售渠道安排专属算力。

Q9. 计费具体是怎么运作的?

文本模型按 token 计费,转写按音频小时计费,没有订阅成分。扣款起初是渐进式的:累计用量跨过 1、10、100、500 与 1,000 美元时出账,此后转为纯月结。低于 0.50 美元不出账,控制台可配置支出上限与预算告警。

Q10. Groq 稳定到可以用来做生意吗?

GroqCloud 在多次重大公司变动中(NVIDIA 授权协议、创始人离开、领导层更替)持续运行未中断,公司也于 2026 年 8 月以 35 亿美元估值完成 3.5 亿美元 A 轮。实际风险与其说是公司消失,不如说是模型更替:请把模型 ID 做成可配置项、盯住弃用通知,并在同一接口后面保留第二家服务商。

发现类似工具?
如果你知道其他优秀的AI工具,欢迎提交给我们