Groqは AI 推論クラウドです。ログインして対話するアプリケーションではなく、リクエストを送る先のインフラです。同社は自らを「高速推論のための最上位ネオクラウド」と位置づけ、インフラ・推論・制御をひとつのプラットフォームに統合したと説明しています。製品の語り口はすべて、ひとつの区別の上に成り立っています。学習はモデルを生み出し、推論はそのモデルが実際に使われるたびに起きること、という区別です。公式サイトはこれを端的に述べています。学習が可能性を生み、推論が価値を生む、と。顧客対応の一件、エージェントのタスク完了ひとつ、コードレビュー一回が、すべて推論の呼び出しです。製品が AI に依存するほど、この呼び出しがボトルネックになります。
Groqがほかのクラウド事業者と違うのは、シリコン層から出発した点です。同社は学習ではなく学習済みモデルの実行に特化したプロセッサ LPU を世に出し、現在はそのハードウェアを NVIDIA のアクセラレーテッドコンピューティングと並行して運用し、グローバルな本番クラウドとして提供しています。開発者にとって、この一切はひとつの HTTPS エンドポイントの背後に隠れています。OpenAI SDK の base_url を https://api.groq.com/openai/v1 に向け、API キーを差し替えれば、既存のコードがそのまま Groq 上で動きます。課金はシート数や月額ではなく、消費したトークンに基づきます。
提供されるモデルカタログは意図的にオープンです。Groqは独自のフロンティアモデルをホストするのではなく、クローズドな API が通常は到達しない速度でオープンウェイトモデルを提供します。GPT-OSS、Qwen、Whisper、そして歴史的には Llama 系列がその対象です。このトレードオフこそ、この製品を理解する上で最も重要な点です。市場で最も強力なクローズドモデルへのアクセスを手放す代わりに、レイテンシ、スループット、価格の予測可能性を得ます。応答速度そのものが製品の機能である場合、Groqは非常に適しています。時間がどれだけかかっても最高性能のモデルが必要な場合には、適していません。
LPUを基盤とする推論ハードウェア: LPU(Language Processing Unit)は、学習ではなく推論のために設計された Groq 自社開発のシリコンです。公表されているラック単位の数値は、ラックあたり LPU 256基、SRAM 帯域幅 40 PB/s、ラックあたりオンチップ SRAM 128 GB、FP8 推論演算 315 PFLOPS、ユーザーあたり毎秒 1,000 トークンです。アーキテクチャ上の賭けは、モデルの重みを外部メモリからストリーミングするのではなく高速なオンチップメモリに保持することが、GPU サービングがぶつかるレイテンシの下限を取り払うという点にあります。
OpenAI互換API: 移行は意図的に些細な作業に設計されています。base URL とキーを変えるだけで、既存の OpenAI クライアントライブラリをそのまま使いながら、アプリケーションは別のハードウェア上で動きます。Groqは自社製の Python および TypeScript SDK も提供しています。もともと OpenAI 向けに書かれたプロジェクトで、Groqが「アドレスを変えるだけの高速化」として頻繁に登場するのは、この設計判断のためです。
オープンウェイトのモデルカタログ: 本番カタログはオープンウェイトモデルを中心に構成されています。テキストは openai/gpt-oss-120b と openai/gpt-oss-20b、音声は whisper-large-v3 と whisper-large-v3-turbo です。プレビュー枠には Qwen3.6 27B、コンテンツモデレーション用の GPT-OSS Safeguard、プロンプトインジェクション検知用の Llama Prompt Guard、Orpheus の音声合成といった、より新しいまたは特化したモデルが入ります。ドキュメントには各モデルの速度、単価、レート制限、コンテキストウィンドウ、最大補完長が記載されており、コードを書く前にコストを見積もれます。
Compound:モデルと組み込みツールの組み合わせ: 素のモデルエンドポイントに加えて、Groqはシステムと呼ぶものを提供します。Groq Compound は公開モデルで駆動される AI システムで、ウェブ検索やコード実行を含む組み込みツールを選択的に使ってクエリに答えます。Compound と Compound Mini は毎秒約 450 トークン、コンテキストウィンドウ 131,072 トークンで動作し、ツール呼び出しのループを自作せずにエージェント的な振る舞いを得られます。
独立した製品ラインとしての音声認識: ここでの Whisper は付随機能ではありません。トークンではなく音声時間に基づく独自の課金単位、時間あたり・日あたりの音声秒数という独自のレート制限軸、100 MB のファイル上限、専用の文字起こしと翻訳のエンドポイントを備えています。議事録、通話分析、字幕パイプラインを構築するチームは、テキスト生成まで移行せずに音声処理の工程だけ Groq を使えます。
信頼性要件に応じたサービス階層: service_tier というパラメータひとつで、リクエストのスケジューリング方法が決まります。on_demand は既定値で、通常の Groq の速度に加えピーク時に時折キュー待ちが生じます。flex は信頼性と引き換えに余裕を得るもので、同一価格で 10 倍のレート制限ですがベストエフォートです。performance はレイテンシが重要な本番向けのエンタープライズ階層、auto はその時点で利用可能な最適階層を選びます。
エンタープライズ向けの制御と専有キャパシティ: プラットフォームは三層構造で販売されます。GroqMetal が専有ベアメタルインフラを、GroqCore がその上に検証済みの推論スタックを、GroqAssured がさらにその上にエンタープライズグレードのガバナンス、監査可能性、制御を重ね、各層は下位層を含みます。この構造により、企業は共有 API から始めて、統合方法を変えずに専有キャパシティへ移行できます。
グローバル展開: Groqは四大陸に 13 のデータセンターを運用しています。Liberty Lake、ダラスから、ヴァンター、シドニー、ロンドン、リヤドまで広がり、カナダとサウジアラビアの拠点も含まれます。レイテンシに敏感なアプリケーションでは、利用者との物理的な距離がチップの速度と同じくらい重要です。
リアルタイム対話インターフェース: ユーザーが文字の出現を見つめている場面では、毎秒 50 トークンと 500 トークンの差は、待つことと読むことの差になります。サポートアシスタント、製品内のコパイロット、音声エージェントが最も適した用途です。体感上の応答性がそのまま機能だからです。Groq上の高速な小型モデルで単純なクエリの九割を処理し、残りを別のモデルにエスカレーションする構成がよく使われます。
エージェントループとツール呼び出しの連鎖: 計画し、ツールを呼び、結果を読み、また計画するエージェントは、レイテンシにステップ数を掛け合わせます。1 ステップ 2 秒の 5 ステップは 10 秒の待ちですが、1 ステップ 300 ミリ秒なら即座に感じられます。高速推論の複利効果が最も劇的に現れる場面であり、Groqが単発生成よりもコーディングエージェントやワークフロー自動化の土台で頻繁に使われる理由です。
大量のテキスト処理と分類: 溜まったドキュメントの要約、サポートチケットのタグ付け、数万件のレコードからの構造化フィールド抽出といった作業は、単一リクエストのレイテンシよりスループットと単位コストを重視します。flex 階層はまさにこの形の作業のために存在し、同じトークン単価で標準の 10 倍のレート制限を提供します。遅延ウィンドウを許容できるジョブはバッチ処理に回せます。
文字起こしと音声パイプライン: Groq上の Whisper は会議録音、ポッドキャストのアーカイブ、コールセンター音声、字幕生成を処理し、トークンではなく音声時間で課金されます。文字起こしとテキスト生成が同じ API と同じキーの背後にあるため、通話を文字起こしして要約するパイプラインでも取引先はひとつで済みます。
プロトタイピングとコスト管理された実験: 無料枠はクレジットカード不要で、抑えられたレート制限のもとモデルカタログにアクセスできます。そのためハッカソン、個人プロジェクト、社内デモの最初の寄港地になることが多いのです。支払い方法を追加すればサブスクリプションを約束せずに上限が上がるため、プラットフォーム評価のコストは実使用量の範囲に収まります。
既存の OpenAI アプリケーションの移行: API がクライアントライブラリのレベルで互換であるため、チームは Groq を確定的な選択ではなくベンチマークとして使うことが少なくありません。設定を二行変えて同じプロンプトを両者に送り、レイテンシ、コスト、出力品質を比較するやり方です。恒久的に移行するワークロードもあれば、タスクごとに使い分け続けるものもあります。
Groqコンソールでアカウントを作成します。 メール認証を済ませると組織(organisation)に所属します。クォータがユーザー単位ではなく組織単位で集計されるため、この点は重要です。
APIキーを発行します。 コンソールでキーを作成し、GROQ_API_KEY のような環境変数に保存してください。ソース管理には決してコミットしないこと。このキーは組織アカウントの実支出を承認します。
クライアントをGroqに向けます。 すでに OpenAI SDK を使っているなら、base_url を https://api.groq.com/openai/v1 に設定し、api_key に Groq のキーを渡すだけです。新規なら Python は groq、TypeScript は groq-sdk を導入します。最初のリクエストは openai/gpt-oss-20b のようなモデル ID を指定する通常の chat completion 呼び出しです。
タスクに合ったモデルを選びます。 決める前にサポートモデルのページを読んでください。モデルごとの毎秒トークン速度、100 万トークンあたりの価格、レート制限、コンテキストウィンドウ、最大補完トークンが一覧になっています。出荷するものには必ず本番モデルを使ってください。プレビューモデルは評価用であり、短い予告で終了する可能性があります。
サービス階層を決め、レート制限に対処します。 既定のオンデマンド動作でよければ service_tier は未設定のままに、有料プラン移行後の高スループットなバッチ的作業には flex を指定します。x-ratelimit-remaining-tokens と x-ratelimit-remaining-requests のレスポンスヘッダーを読み、HTTP 429 と flex の HTTP 498 に対してジッター付きバックオフのリトライを実装してください。
規模を拡げる前に課金の制御を入れます。 支払い方法を紐づけて無料枠の上限を解除し、コンソールで支出上限と使用量アラートを設定します。見積もりが最も当てにならない本番稼働の最初の一週間は、Dashboard → Usage で消費を注視してください。
最大のモデルを既定にせず、タスクに合わせて選ぶ。 Groqでは小型モデルが明確に高速かつ安価で、分類、抽出、ルーティング、短文生成では品質差がユーザーに見えないことが多くあります。大きいモデルが必要だと決め込む前に、自分のプロンプトで gpt-oss-20b と gpt-oss-120b を比較してください。速度差はおおよそ二倍です。
モデルの提供終了を初日から前提に設計する。 Groqのカタログは入れ替わりが早いのが実情です。モデル ID をハードコードせず設定から読み込み、提供終了ページに目を配り、アカウントのメールアドレスが移行通知に実際に対応する人に届くようにしてください。コードを迅速に再デプロイできないなら、消えたモデル ID はそのまま障害になります。
APIキーを増やして余裕を買おうとしない。 レート制限はユーザーやキーではなく組織単位で適用されるため、キーを追加しても上限は変わりません。スループットが必要なら、支払い方法の追加、flex 階層への移行、営業経由での専有キャパシティ確保のいずれかを選んでください。
初回トークンのレイテンシと総レイテンシを分けて計測する。 Groqの優位性は両方に現れますが、原因は異なります。初回トークンが遅いのは通常キュー待ちかリージョンの遠さ、補完が遅いのは通常必要以上に生成していることを意味します。max_tokens は思い切って絞ってください。どのハードウェアでも短い答えのほうが速いのです。
プロンプトキャッシュを活かし、システムプロンプトを安定させる。 キャッシュされたトークンはレート制限に計上されないため、リクエスト間でシステムプロンプトを一定に保つとコストが下がると同時に実効スループットも得られます。呼び出しごとにシステムプロンプトを書き換えるのは、その利得を捨てることです。
リトライを正しく実装する。flex では特に。 flex 階層は明示的にベストエフォートです。キャパシティ不足の失敗は想定内で、すぐに返り、安全に再試行できます。ここではジッター付き指数バックオフは選択肢ではありません。HTTP 498 はユーザーに出すエラーではなく「少し後に再試行」として扱ってください。
機微なデータを送る前にゼロデータ保持を有効にする。 ZDR は全顧客が利用できますが既定ではなく、有効にすると永続化に依存する機能も同時に無効になります。このトレードオフは最初の本番リクエストの後ではなく、前に決めるべきです。
別の事業者へ切り替える経路を残しておく。 API が双方向で OpenAI 互換であるため、同じインターフェースの背後に二社目を設定しておくコストは小さく、キャパシティ障害、提供終了、価格改定に対する備えになります。
レイテンシに敏感なAI機能を作るアプリケーション開発者: ユーザーが文字の出現を見つめる製品、つまりチャット UI、コパイロット、音声プロダクトでは、速度がそのまま体感品質に変換されるため恩恵が最も直接的です。
エージェントや多段ワークフローを構築するチーム: レイテンシがステップごとに掛け算される場面では、高速推論の価値は単発リクエストのベンチマークが示す以上になります。エージェントフレームワーク、コーディングアシスタント、自動化パイプラインが自然な適用先です。
すでにOpenAI SDKに投資しているエンジニア: コードベースが OpenAI のクライアントライブラリ前提で書かれているなら、Groqの評価は書き直しではなく設定変更で済みます。この乗り換えコストの低さがプラットフォーム最大の獲得経路です。
単純タスクを大量に回すコスト重視のチーム: 大規模な分類、タグ付け、抽出、要約は、独自のフロンティアモデルよりオープンウェイトの小型モデルのほうがはるかに安価で、トークン単位の課金により計算も単純です。
スタートアップとプロトタイプ制作者: クレジットカード不要の無料枠と、サブスクリプションの下限がない従量課金は、始めやすく畳みやすい環境を作ります。初期段階のチームが求めるのはまさにこれです。
レイテンシ・ガバナンス・データ所在地の要件がある企業: GroqAssured、performance サービス階層、ゼロデータ保持、専有ベアメタルキャパシティは、共有のベストエフォートなエンドポイントでは運用できない組織のために存在します。
音声・文字起こし製品を作るチーム: 音声時間あたりで課金される Whisper、独立した音声レート制限、翻訳エンドポイントにより、テキスト生成に Groq を使うかどうかとは無関係に、文字起こしのベンダーとしてだけ採用できます。
https://api.groq.com/openai/v1 にて chat completions、Responses API、音声の文字起こし・翻訳・合成、バッチ、ファイル、ファインチューニングの各エンドポイントを提供します。console.groq.com でアカウント管理、API キー、プロジェクト、モデル権限、使用量ダッシュボード、支出上限、データコントロールに加え、完全なドキュメントと API リファレンスを提供します。無料枠。 Groqはクレジットカード不要の無料開発者枠を提供し、抑えられたレート制限のもとモデルカタログにアクセスできます。プロトタイピング、個人プロジェクト、社内デモ、低トラフィックの機能には実用的で、先に到達する上限はトークン数より一日あたりのリクエスト数であることが多いです。構造上重要なのは、上限が組織単位で集計されるため、キーを増やしても無料アカウントの枠は広がらないという点です。
従量課金。 API 利用にサブスクリプション料金はありません。テキストモデルは 100 万トークン単位で入力と出力を別々に課金します。たとえば gpt-oss-120b は 100 万トークンあたり入力 0.15 ドル、出力 0.60 ドル、gpt-oss-20b は 0.075 ドルと 0.30 ドルです。音声認識は音声時間で課金され、whisper-large-v3 は 1 時間あたり 0.111 ドル、turbo 版は 0.04 ドルです。支払い方法を追加するとレート制限が大幅に上がり、同じトークン単価でより高いスループットを提供する flex とバッチ処理の階層が解放されます。第三者ベンチマークの Artificial Analysis による実測では、カタログ全体のブレンド単価はおよそ 100 万トークンあたり 0.05〜0.84 ドルで、モデル間の開きは約 16 倍です。
請求の仕組み。 課金は当初は累進的で、その後は月次に移行します。累計利用額が 1、10、100、500、1,000 ドルの各しきい値を初めて超えたときに即時請求され、インド国内の顧客には別のスケジュールが適用されます。0.50 ドル未満の請求書は発行されません。コンソールで支出上限と予算アラートを設定でき、使用量はほぼリアルタイムで確認できます。
エンタープライズ。 支出コミット契約、performance サービス階層、専有 GroqMetal キャパシティ、GroqAssured ガバナンス層は、セルフサービスではなく営業経由での販売です。エンタープライズ契約にはキャパシティ以外の実利もあります。無料および開発者階層に適用されるモデルの提供終了が、支出コミット顧客には免除されるのです。カタログと価格は頻繁に変わるため、正確な条件と現行レートは公式ドキュメントとコンソールで確認してください。
モデルカタログの入れ替わりが非常に激しい。 これが最も実務的なリスクです。Groq自身の提供終了ページには絶え間ない退役の記録が残っています。llama-3.1-8b-instant と llama-3.3-70b-versatile は 2026 年 8 月 16 日にともに退役し、qwen3-32b と llama-4-scout はその 1 か月前に、さらにその前には Kimi K2 と Llama 4 Maverick が削除されました。提供終了は無料および開発者階層に適用され、支出コミット済みのエンタープライズ顧客は免除されます。つまり最も保護の薄い利用者が入れ替えのコストを最も多く負う構図です。プレビューモデルには短い予告で終了しうるという明示的な警告が付いています。
OpenAI互換は近いが完全ではない。 OpenAI 向けのコードに現れる複数のパラメータがそのまま失敗します。logprobs、logit_bias、top_logprobs、messages[].name はいずれも 400 エラーを返し、n は 1 でなければなりません。音声の文字起こしは vtt と srt を出力せず、temperature 0 は静かに 1e-8 に書き換えられます。一般的なケースの移行は容易でも周辺で壊れうるため、想定せず検証してください。
能力の上限はオープンウェイトのカタログに規定される。 速度は本物ですが、それは中規模のオープンモデル上での速度です。Artificial Analysis の独立ベンチマークでは、追跡対象である 11 の Groq モデルのうち知能指数が最も高いのは 38 点の Qwen3.6 27B で、独自のフロンティアモデルには遠く及びません。最も難しい推論、長期にわたるコーディング、機微を要する文章では、遅くともフロンティアモデルのほうが良い結果を出す場合があります。
レート制限は組織単位かつ多次元。 毎分リクエスト数、毎日リクエスト数、毎分トークン、毎日トークン、音声秒数が同時に適用され、最初に到達した軸で絞られます。小さなリクエストを大量に送るパターンでは、トークン枠をほとんど使わないままRPMを使い切ることがあります。組織によっては入力と出力のトークン制限が別建てで課されます。
flex階層は明示的にベストエフォート。 同じ価格で 10 倍のレート制限を提供しますが、キャパシティがない場合は HTTP 498 と capacity_exceeded エラーで失敗します。これは欠陥ではなく意図した設計であり、そのため代替経路のないユーザー向け経路に flex は不向きです。
データ所在地は米国に固定。 推論リクエストは既定では保持されず、ゼロデータ保持は全顧客が利用できますが、保持されるデータは米国内の Google Cloud Platform バケットに置かれ、越境移転には標準契約条項が適用されます。EU やアジア太平洋の厳格な所在地要件がある組織は自らのコンプライアンス義務と照合して確認すべきであり、ZDR を有効にするとバッチジョブやファインチューニングなど永続化に依存する機能が無効になる点にも留意してください。
企業としての状況は近年大きく動いた。 2025 年 12 月、DataCenterDynamics は、創業者 Jonathan Ross と社長 Sunny Madra が非独占の技術ライセンス契約のもとで NVIDIA へ移り、Groq は Simon Edwards のもとで独立企業として運営を続け、GroqCloud は中断なく稼働すると報じました。取引規模に関する報道は一貫していません。広く引用される 200 億ドルという数字は独立には検証されておらず、非独占ライセンスの条件は開示されたことがありません。2026 年 8 月のシリーズ A は企業価値を 35 億ドルと評価しましたが、これは 2025 年 9 月の調達時の 69 億ドルのおよそ半分です。サービスの継続性は一貫して保たれてきたものの、複数年のインフラ投資を検討するチームは、技術と併せて所有構造と経営陣の変化も勘案すべきです。
独立したユーザー評価データが薄い。 Groqは報道量こそ豊富ですが、体系的なレビュープラットフォームのフィードバックは非常に少ないのが実情です。G2 の掲載項目のレビュー件数は無視できる水準で、第三者ディレクトリは Groq を消費者向けチャットボットではなく AI API、大規模言語モデル、オープンソース AI モデルに分類していますが、そこでも意味のあるレビュー量はありません。現在得られる最も強い独立証拠は利用者の証言ではなくベンチマークデータであるため、サポート品質や長期的な信頼性に関する主張は未検証として扱うべきです。
Grokと混同しないこと。 Groq(groq.com)は Groq LLC の推論インフラであり、Grok(grok.com)はイーロン・マスク氏の xAI による消費者向けチャットアシスタントです。名前は一文字の位置が違うだけですが、製品には共通点がありません。企業も対象利用者もビジネスモデルも異なります。
はい。クレジットカード不要の無料開発者枠があり、抑えられたレート制限のもとでモデルカタログにアクセスできます。プロトタイピングや低トラフィックのプロジェクトには十分です。支払い方法を追加すると上限が大きく上がり、flex とバッチ階層も解放されます。サブスクリプション料金はなく、トークン利用に応じた課金のみです。
綴りがほぼ同じため混同されがちですが、無関係な製品です。groq.com の Groq は LPU ハードウェア上に構築され、開発者に API として販売される AI 推論クラウドです。grok.com の Grok は xAI の消費者向けチャットアシスタントです。企業も製品も課金モデルも異なります。
多くの場合、二点の変更で可能です。base URL を https://api.groq.com/openai/v1 に設定し、Groq の API キーを渡すことです。ただし logprobs、logit_bias、top_logprobs、messages[].name は未対応で 400 エラーを返し、n は 1 でなければなりません。きれいに差し替わると想定せず、自分の呼び出しパターンを検証してください。
Groqは独自のフロンティアモデルではなくオープンウェイトモデルを提供します。本番カタログはテキストの openai/gpt-oss-120b と openai/gpt-oss-20b、音声の whisper-large-v3 とその turbo 版が中心で、プレビュー枠には Qwen3.6 27B、安全性分類器、Orpheus の音声合成などが入ります。現在の一覧はモデルドキュメントと /openai/v1/models エンドポイントでいつでも確認できます。
Artificial Analysis の独立ベンチマークでは、Groq上で最速のモデルは高推論設定の gpt-oss-20b で中央値 毎秒 949 トークン、最初のトークンまでの最短時間は約 0.77 秒です。Groq自身のハードウェア数値はユーザーあたり最大 毎秒 1,000 トークンを示しています。実際のスループットはモデル、プロンプト長、サービス階層、負荷によって変動します。
Groqは推論リクエストについて顧客データを既定では保持しないと明記しています。保持されるのはバッチジョブやファインチューニングのように永続化を要する機能、または信頼性のトラブルシューティングと不正利用の調査のための一時的な記録に限られ、後者は最長 30 日です。全顧客がゼロデータ保持を有効にできますが、有効にすると永続化に依存する機能は無効になります。
推論は四大陸 13 のデータセンターで実行されますが、保持される顧客データは米国内の Google Cloud Platform バケットに保存され、該当する場合は標準契約条項が移転を規律します。厳格な地域所在地要件のある組織は自組織の規程と照合して確認してください。
いいえ。レート制限は組織単位で適用されるため、追加のキーは同じクォータを共有します。余裕が必要なら、支払い方法を追加して開発者階層の上限に移る、高スループットな作業に flex 階層を使う、営業経由で専有キャパシティを手配する、のいずれかを選んでください。
テキストモデルはトークン単位、文字起こしは音声時間単位で課金され、サブスクリプション要素はありません。当初は累進的で、累計利用額が 1、10、100、500、1,000 ドルを超えた時点で請求され、その後は純粋な月次請求に移行します。0.50 ドル未満は請求書が発行されず、コンソールで支出上限と予算アラートを設定できます。
GroqCloud は NVIDIA とのライセンス契約、創業者の離脱、経営陣の交代といった大きな変化を通じて中断なく稼働し続けており、同社は 2026 年 8 月に企業価値 35 億ドルで 3 億 5,000 万ドルのシリーズ A を調達しました。実務的なリスクは会社の消滅よりモデルの入れ替わりです。モデル ID を設定可能にし、提供終了の通知を監視し、同じインターフェースの背後に二社目を用意しておいてください。