Groq 是一家 AI 推論雲服務商——你把請求送給它,而不是登入進去跟它聊天。官網自述為「面向快速推論的領先 neocloud」,把基礎設施、推論與控制整合進同一個平台。它整套產品敘事都建立在一個區分之上:訓練產出模型,而推論是模型每一次被真正使用時所發生的事。官網把這句話講得很直白——訓練創造可能性,推論創造價值。每一次客服回應、每一個智慧代理任務的完成、每一次程式碼審查,本質上都是一次推論呼叫;產品越依賴 AI,這次呼叫就越容易成為瓶頸。
Groq 在雲服務商裡的特殊之處,在於它是從晶片層做起的。公司首創了 LPU——一種專為執行已訓練模型而非訓練模型所設計的處理器——如今把這套硬體與 NVIDIA 加速運算並行營運為一朵全球生產級雲。而對開發者而言,這一切都藏在一個 HTTPS 端點後面:把 OpenAI SDK 的 base_url 指向 https://api.groq.com/openai/v1,換掉 API key,原有程式碼就跑在 Groq 上了。計費按消耗的 token 計算,不按席次也不按月。
它提供的模型目錄是刻意開放的。Groq 不託管閉源前沿模型,而是以閉源 API 通常達不到的速度提供開放權重模型——GPT-OSS、Qwen、Whisper,以及歷史上的 Llama 系列。這個取捨是理解這款產品最關鍵的一點:你放棄了對市面上最強閉源模型的存取,換來延遲、吞吐與價格的可預測性。當回應速度本身就是產品特性時,Groq 非常合適;當你需要不計等待也要用上最強模型時,它就不是正確選擇。
基於 LPU 的推論硬體:LPU(語言處理單元)是 Groq 自研的晶片,為推論而非訓練而設計。官網公布的機架級指標為每機架 256 顆 LPU、40 PB/s 的 SRAM 頻寬、每機架 128 GB 晶片內 SRAM,以及 315 PFLOPS 的 FP8 推論算力,單一使用者吞吐標稱 1,000 tokens/秒。其架構賭注在於:把模型權重放在高速晶片內記憶體,而非從外部顯示記憶體串流讀取,才能突破 GPU 服務所遇到的延遲下限。
OpenAI 相容 API:遷移被刻意做得極為簡單。改 base URL、改 key,繼續用你原有的 OpenAI 用戶端函式庫,應用程式就跑在另一套硬體上了。Groq 同時提供官方 Python 與 TypeScript SDK。正是這一個設計決策,讓 Groq 頻繁出現在原本基於 OpenAI 撰寫的專案裡,作為一次「換個位址就提速」的升級。
開放權重模型目錄:生產級目錄以開放權重模型為核心——文字側是 openai/gpt-oss-120b 與 openai/gpt-oss-20b,語音側是 whisper-large-v3 與 whisper-large-v3-turbo。預覽位則放更新或更專門的模型:Qwen3.6 27B、用於內容審核的 GPT-OSS Safeguard、用於注入偵測的 Llama Prompt Guard,以及 Orpheus 語音合成。文件裡每個模型都標註了速度、單價、速率限制、脈絡視窗與最大補全長度,寫程式之前就能把成本算清楚。
Compound:模型加內建工具:除了裸模型端點,Groq 還提供「系統」。Groq Compound 是一套由開放模型驅動的 AI 系統,會有選擇地呼叫內建工具(含網頁搜尋與程式碼執行)來回答查詢。Compound 與 Compound Mini 速度約 450 tokens/秒,脈絡視窗 131,072 token,讓你不必自己搭工具呼叫迴圈就能獲得智慧代理行為。
語音轉寫是獨立產品線:Whisper 在這裡不是附屬功能。它有獨立計價單位(按音訊小時而非 token)、獨立的限流維度(每小時與每天的音訊秒數)、100 MB 的檔案上限,以及專用的轉寫與翻譯端點。做會議紀要、通話分析或字幕管線的團隊,可以只在音訊環節用 Groq,而不必把文字生成也遷過來。
面向不同可靠性需求的服務層級:一個 service_tier 參數決定請求如何被調度。on_demand 是預設值,提供 Groq 常規速度,尖峰時段偶有排隊;flex 用可靠性換取上限——十倍速率限制、同樣價格、盡力而為;performance 是面向延遲敏感生產環境的企業層;auto 則自動選擇當下對你可用的最佳層級。
企業控制與專屬算力:平台按三層堆疊銷售。GroqMetal 提供專屬裸機基礎設施,GroqCore 在其上疊加經過驗證的推論堆疊,GroqAssured 再疊加企業級治理、可稽核性與控制,每層都包含其下各層。這個結構讓企業可以先從共享 API 起步,之後遷到專屬算力而無需改動整合方式。
全球佈署:Groq 在四大洲營運 13 座資料中心,從 Liberty Lake、Dallas 到 Vantaa、雪梨、倫敦與利雅德,另有加拿大與沙烏地阿拉伯站點。對延遲敏感的應用來說,與使用者的實體距離和晶片速度同樣重要。
即時對話介面:當使用者正盯著文字一個個蹦出來時,每秒 50 token 與每秒 500 token 的差別,就是「等待」與「閱讀」的差別。客服助理、產品內嵌副駕與語音智慧代理是最直接的適配場景,因為感知上的回應速度就是產品力本身。一種常見做法是:用 Groq 上的快速小模型處理九成簡單查詢,把其餘的升級路由給更強但更慢的模型。
智慧代理迴圈與工具呼叫鏈:一個「規劃—呼叫工具—讀結果—再規劃」的智慧代理,會把延遲乘以步數。五步鏈路每步兩秒是十秒等待,同樣鏈路每步 300 毫秒則近乎瞬時。這是快速推論複利效應最明顯的地方,也是 Groq 常被用在編碼代理與工作流自動化底層、而非單次生成場景的原因。
批次文字處理與分類:給積壓文件做摘要、給工單貼標籤、從上萬筆記錄裡抽取結構化欄位——這類工作在意的是吞吐與單位成本,而非單次延遲。flex 層正是為這種形態設計的:十倍標準限額、同樣的按 token 單價;能容忍延遲視窗的任務還可以走批次處理。
轉寫與音訊管線:Groq 上的 Whisper 可處理會議錄音、Podcast 典藏、客服中心音訊與字幕生成,按音訊小時而非 token 計價。由於轉寫與文字生成共用同一套 API 與同一把金鑰,一條「先轉寫通話、再生成摘要」的管線只需維護一家供應商關係。
原型驗證與成本可控的試驗:免費額度無需信用卡即可存取模型目錄(限額較低),因此 Groq 常成為黑客松專案、業餘專案與內部展示的第一站。綁定付款方式即可提升限額,且不必承諾訂閱,評估平台的成本被實際用量所限定。
遷移既有的 OpenAI 應用:因為 API 在用戶端函式庫層面相容,團隊常把 Groq 當作對照基準而非直接承諾——用兩行設定改動,把同一批提示詞分別打到兩家,比較延遲、成本與輸出品質。有些工作負載會永久遷移,有些則按任務類型長期分流。
在 Groq Console 註冊帳號。 完成電子郵件驗證後你會進入一個組織(organisation)——這一點很重要,因為配額是按組織統計的,不是按使用者。
產生 API key。 在主控台建立金鑰,並存為環境變數(如 GROQ_API_KEY)。切勿提交進程式碼倉庫;這把金鑰授權的是你組織帳戶上的實際花費。
把用戶端指向 Groq。 如果你已在用 OpenAI SDK,把 base_url 設為 https://api.groq.com/openai/v1,api_key 傳入 Groq 金鑰即可。如果是全新開始,安裝官方 groq(Python)或 groq-sdk(TypeScript)。第一個請求就是一次普通的 chat completion 呼叫,模型 ID 可用 openai/gpt-oss-20b。
為任務挑對模型。 定案之前先讀一遍支援模型頁:它列出了每個模型的每秒 token 速度、每百萬 token 單價、速率限制、脈絡視窗與最大補全 token 數。準備上線的東西一律優先選生產模型——預覽模型是給評估用的,可能在極短通知期內下線。
設定服務層級並處理限流。 想要預設的按需行為就不傳 service_tier;轉為付費方案後,高吞吐的批次型任務可設為 flex。讀取 x-ratelimit-remaining-tokens 與 x-ratelimit-remaining-requests 回應標頭,並對 HTTP 429(以及 flex 的 HTTP 498)實作帶抖動的退避重試。
擴量之前先加上帳單控制。 綁定付款方式以解除免費額度上限,然後在主控台設定支出上限與用量警示。上線第一週務必在 Dashboard → Usage 盯緊消耗——那正是預估最不準的階段。
按任務選模型,別預設用最大的那個。 在 Groq 上,小模型明顯更快也更便宜;對於分類、抽取、路由與短文字生成,品質差距往往使用者根本感知不到。在假定自己需要大模型之前,先用你自己的提示詞把 gpt-oss-20b 與 gpt-oss-120b 跑一遍比較——兩者速度差距大致是兩倍。
從第一天就為模型棄用做設計。 Groq 的目錄更替很快。把模型 ID 放進設定而非寫死,留意棄用頁面,並確保帳號信箱是有人會真的去處理遷移通知的位址。如果你的程式碼不能快速重新部署,一個消失的模型 ID 就是一次故障。
別指望靠多開 API key 買到額度。 速率限制按組織而非按使用者或按金鑰計算,多簽發金鑰不會提高你的天花板。需要更多吞吐,就綁付款方式、轉 flex 層,或者聯絡業務談專屬算力。
把首字延遲與總延遲分開監控。 Groq 的優勢在兩者上都體現,但它們的病因不同:首字慢通常意味著排隊或區域距離過遠,補全慢則通常意味著模型生成了超出你需要的內容。把 max_tokens 卡緊一些——在任何硬體上,更短的答案都更快。
用好提示快取,保持系統提示詞穩定。 快取 token 不計入速率限制,所以跨請求保持穩定的系統提示詞既降成本又變相買到吞吐。每次呼叫都重寫系統提示詞,等於把這份收益扔掉。
重試要做對,flex 層尤其如此。 flex 層被明確定義為盡力而為:容量失敗是預期內的、會快速回傳、且可以安全重試。在那裡帶抖動的指數退避不是可選項。把 HTTP 498 當成「稍後再試」,而不是要拋給使用者的錯誤。
傳送敏感資料之前先開啟零資料保留。 ZDR 對所有客戶開放,但不是預設狀態,而且啟用它同時會停用依賴持久化的功能。這個取捨要在第一個生產請求之前決定,而不是之後。
保留一條切換到其他服務商的通路。 由於 API 在兩個方向上都與 OpenAI 相容,在同一介面後面多配一家服務商成本很低,卻能讓你在容量事件、模型棄用與調價面前留有餘地。
建構延遲敏感 AI 功能的應用開發者:只要你的使用者在盯著文字出現——聊天介面、副駕、語音產品——收益就最直接,因為速度會直接轉化為感知上的品質。
建構智慧代理與多步工作流的團隊:當延遲隨步數相乘時,快速推論的價值遠高於單次請求基準所顯示的。智慧代理框架、編碼助理與自動化管線是天然適配對象。
已投入 OpenAI SDK 的工程師:如果你的程式碼庫是照著 OpenAI 用戶端函式庫寫的,評估 Groq 只需改設定而非重寫。這種極低的切換成本是該平台最有效的獲客通道。
跑大量簡單任務、對成本敏感的團隊:規模化的分類、貼標、抽取與摘要,跑在開放權重小模型上遠比跑在閉源前沿模型上便宜,而 Groq 的按 token 計價讓這筆帳很好算。
新創公司與做原型的人:免費額度無需信用卡、按量付費無訂閱門檻,讓這個平台既容易上手也容易放棄——這恰恰是早期團隊想要的。
有延遲、治理或資料落地要求的企業:GroqAssured、performance 服務層、零資料保留與專屬裸機算力,正是為那些不能跑在共享盡力而為端點上的組織準備的。
做音訊與轉寫產品的團隊:按音訊小時計價的 Whisper、獨立的音訊限流維度與翻譯端點,讓 Groq 可以單獨作為轉寫供應商使用,與你是否用它做文字生成無關。
https://api.groq.com/openai/v1,涵蓋 chat completions、Responses API、音訊轉寫、翻譯與語音合成、批次處理、檔案與微調端點。console.groq.com 提供帳號管理、API 金鑰、專案、模型權限、用量儀表板、支出上限與資料控制,以及完整文件與 API 參考。免費額度。 Groq 提供無需信用卡的免費開發者層,可在較低速率限制下存取模型目錄。它對原型驗證、業餘專案、內部展示與低流量功能是真正可用的,通常最先撞到的上限是每日請求數而非 token 數。結構上要注意的一點是:限額按組織統計,所以免費帳戶無法靠多建金鑰來擴容。
按量付費。 API 存取沒有訂閱費。文字模型按每百萬 token 計價,輸入與輸出分別定價——例如 gpt-oss-120b 為輸入 0.15 美元、輸出 0.60 美元每百萬 token,gpt-oss-20b 為 0.075 與 0.30;語音轉寫按音訊小時計費,whisper-large-v3 為每小時 0.111 美元,turbo 版本為 0.04 美元。綁定付款方式會大幅提升速率限制,並解鎖 flex 與批次處理層——兩者在同樣的按 token 單價下提供更高吞吐。第三方基準平台 Artificial Analysis 實測的混合價區間約為每百萬 token 0.05 至 0.84 美元,跨模型價差約十六倍。
帳單機制。 扣款先漸進後月結:累計用量首次跨過 1、10、100、500、1,000 美元這幾個門檻時會立即扣款,之後轉為純月度出帳,印度客戶適用不同的門檻節奏。低於 0.50 美元不出帳。主控台可設定支出上限與預算警示,用量近即時可見。
企業方案。 承諾消費合約、performance 服務層、專屬 GroqMetal 算力與 GroqAssured 治理層透過業務管道而非自助購買。企業合約還有一項容易被忽略的實際好處:適用於免費與開發者層的模型棄用,對簽有承諾消費合約的客戶豁免。由於目錄與價格變動頻繁,具體條款與當期費率請以官網文件與主控台最新頁面為準。
模型目錄更替非常激進。 這是最實際的風險。Groq 自家的棄用頁面記錄了一連串下線:llama-3.1-8b-instant 與 llama-3.3-70b-versatile 於 2026 年 8 月 16 日一同退役,qwen3-32b 與 llama-4-scout 早一個月被移除,此前還有 Kimi K2 與 Llama 4 Maverick。棄用適用於免費與開發者層,而簽有承諾消費合約的企業客戶獲得豁免——這意味著保護最少的使用者承擔了最多的更替成本。預覽模型更帶有「可能在極短通知期內下線」的明確警告。
OpenAI 相容是接近而非完全。 若干在面向 OpenAI 的程式碼中常見的參數會直接失敗:logprobs、logit_bias、top_logprobs 與 messages[].name 均回傳 400 錯誤,n 必須為 1。音訊轉寫不輸出 vtt 與 srt,temperature 設為 0 會被靜默改寫為 1e-8。常見路徑遷移很輕鬆,邊角仍可能翻車,所以要實測而非假定。
能力上限受制於開放權重目錄。 速度是真的,但那是中等規模開放模型上的速度。在 Artificial Analysis 的獨立基準中,其追蹤的 11 個 Groq 模型裡智慧指數最高的是 Qwen3.6 27B,得分 38——明顯低於閉源前沿模型。面對最難的推理、長週期編碼或講究分寸的寫作任務,更慢的前沿模型仍可能產出更好的結果。
速率限制是組織級且多維度的。 每分鐘請求數、每日請求數、每分鐘 token、每日 token 與音訊秒數同時生效,哪一維先觸頂就被哪一維限住——大量微小請求的呼叫模式可能在幾乎沒用掉 token 額度的情況下先耗盡 RPM。部分組織還另有輸入與輸出 token 的分離限制。
flex 層被明確定義為盡力而為。 它以同樣的價格提供十倍速率限制,但容量不足時請求會以 HTTP 498 與 capacity_exceeded 錯誤失敗。這是刻意的設計而非缺陷,也因此 flex 在沒有兜底方案時不適合放在面向使用者的路徑上。
資料落地固定在美國。 儘管推論請求預設不保留、且所有客戶都可啟用零資料保留,但任何被保留的資料都位於美國境內的 Google Cloud Platform 儲存桶中,跨境傳輸在適用情形下依賴標準合約條款。有嚴格歐盟或亞太落地要求的組織應對照自身合規義務確認;另需注意啟用 ZDR 會同時停用依賴持久化的功能,如批次處理任務與微調。
公司層面近期經歷過動盪。 2025 年 12 月,DataCenterDynamics 報導創辦人 Jonathan Ross 與總裁 Sunny Madra 在一項非獨占技術授權協議下加入 NVIDIA,Groq 則由 Simon Edwards 接任 CEO 繼續獨立經營,GroqCloud 不中斷運行。關於交易金額的報導口徑並不穩定:被廣泛引用的 200 億美元數字未經獨立核實,非獨占授權的條款也從未揭露。2026 年 8 月的 A 輪給出 35 億美元估值,約為 2025 年 9 月募資時 69 億美元估值的一半。服務連續性始終得到維持,但要做多年期基礎設施承諾的團隊,應把所有權與領導層變動與技術本身一併權衡。
獨立使用者評價資料很薄。 Groq 的媒體覆蓋量很大,結構化的評測平台回饋卻極少——G2 條目上的評論數微不足道,第三方導覽站把 Groq 歸入 AI API、大語言模型與開源 AI 模型類目而非消費級聊天工具,同樣沒有有意義的評論量。目前可得的最強獨立證據是基準資料而非使用者證言,因此關於客服品質或長期可靠性的說法都應視為未經驗證。
不要與 Grok 混淆。 Groq(groq.com)是 Groq LLC 的推論基礎設施;Grok(grok.com)是 Elon Musk 旗下 xAI 的消費級聊天助理。兩個名字只差一個字母的位置,產品則毫無共同之處——不同公司、不同受眾、不同商業模式。
可以。平台提供無需信用卡的免費開發者層,能在較低速率限制下存取模型目錄,足以支撐原型驗證與低流量專案。綁定付款方式會大幅提升限額並解鎖 flex 與批次處理層;平台沒有訂閱費,只有按 token 的用量費用。
它們是毫無關聯的兩個產品,只因拼寫極為相近而經常被混淆。Groq(groq.com)是建立在 LPU 硬體之上、以 API 形式賣給開發者的 AI 推論雲;Grok(grok.com)是 xAI 的消費級聊天助理。不同公司、不同產品、不同定價模式。
多數情況下可以,只需兩處改動:把 base URL 設為 https://api.groq.com/openai/v1,並傳入 Groq API key。有幾個參數不受支援並會回傳 400 錯誤——logprobs、logit_bias、top_logprobs 與 messages[].name——且 n 必須為 1,所以請實測你自己的呼叫模式,別假定一定能乾淨切換。
Groq 提供的是開放權重模型而非閉源前沿模型。生產目錄以文字側的 openai/gpt-oss-120b、openai/gpt-oss-20b 與語音側的 whisper-large-v3 及其 turbo 版本為核心,預覽位則放 Qwen3.6 27B、安全分類模型與 Orpheus 語音合成等。當前清單始終可從模型文件與 /openai/v1/models 端點取得。
第三方基準平台 Artificial Analysis 實測:Groq 上最快的模型是高推理檔的 gpt-oss-20b,中位速度 949 tokens/秒,最低首 token 時間約 0.77 秒。Groq 自報的硬體指標為單一使用者最高 1,000 tokens/秒。實際吞吐會隨模型、提示長度、服務層級與負載而變化。
Groq 聲明推論請求的客戶資料預設不保留。僅在需要持久化才能運作的功能(如批次處理與微調),或為排查可靠性問題與調查濫用時才會保留,後者最長保留 30 天。所有客戶均可啟用零資料保留,但啟用後依賴持久化的功能會被停用。
推論運行在四大洲的 13 座資料中心,但任何被保留的客戶資料都存放在位於美國的 Google Cloud Platform 儲存桶中,跨境傳輸在適用情形下依賴標準合約條款。有嚴格地域落地要求的組織應對照自身合規規則核實。
不能。速率限制按組織生效,額外的金鑰共享同一份配額。想要更多餘裕,可以綁定付款方式轉入開發者層限額、對高吞吐任務使用 flex 層,或透過業務管道安排專屬算力。
文字模型按 token 計費,轉寫按音訊小時計費,沒有訂閱成分。扣款起初是漸進式的:累計用量跨過 1、10、100、500 與 1,000 美元時出帳,此後轉為純月結。低於 0.50 美元不出帳,主控台可設定支出上限與預算警示。
GroqCloud 在多次重大公司變動中(NVIDIA 授權協議、創辦人離開、領導層更替)持續運行未中斷,公司也於 2026 年 8 月以 35 億美元估值完成 3.5 億美元 A 輪。實際風險與其說是公司消失,不如說是模型更替:請把模型 ID 做成可設定項、盯住棄用通知,並在同一介面後面保留第二家服務商。