Groq는 AI 추론 클라우드입니다. 로그인해서 대화를 나누는 애플리케이션이 아니라, 요청을 보내는 인프라입니다. 회사는 스스로를 "빠른 추론을 위한 최고의 네오클라우드"라고 소개하며 인프라, 추론, 통제를 하나의 플랫폼으로 통합했다고 설명합니다. 제품 서사 전체가 하나의 구분 위에 세워져 있습니다. 학습은 모델을 만들어내고, 추론은 그 모델이 실제로 쓰일 때마다 일어나는 일이라는 구분입니다. 공식 사이트는 이를 직설적으로 표현합니다. 학습이 가능성을 만들고, 추론이 가치를 만든다는 것입니다. 고객 응대 한 건, 에이전트 작업 하나의 완료, 코드 리뷰 한 번이 모두 추론 호출이며, 제품이 AI에 의존할수록 이 호출이 병목이 됩니다.
Groq가 다른 클라우드 사업자와 다른 지점은 실리콘 계층에서 출발했다는 사실입니다. 이 회사는 학습이 아니라 학습된 모델의 실행에 특화된 프로세서인 LPU를 최초로 만들었고, 지금은 그 하드웨어를 NVIDIA 가속 컴퓨팅과 나란히 운영하며 글로벌 프로덕션 클라우드를 굴리고 있습니다. 개발자 입장에서 이 모든 것은 하나의 HTTPS 엔드포인트 뒤에 숨어 있습니다. OpenAI SDK의 base_url을 https://api.groq.com/openai/v1로 바꾸고 API 키만 교체하면 기존 코드가 그대로 Groq 위에서 돌아갑니다. 과금은 좌석 수나 월 단위가 아니라 소비한 토큰 기준입니다.
제공되는 모델 카탈로그는 의도적으로 개방적입니다. Groq는 독점 프론티어 모델을 호스팅하는 대신, 폐쇄형 API가 일반적으로 따라오지 못하는 속도로 오픈 웨이트 모델을 제공합니다. GPT-OSS, Qwen, Whisper, 그리고 과거의 Llama 계열이 그 대상입니다. 이 맞교환이 제품을 이해하는 핵심입니다. 시장에서 가장 강력한 독점 모델에 대한 접근을 포기하는 대신 지연 시간, 처리량, 가격의 예측 가능성을 얻습니다. 응답 속도 자체가 제품 기능일 때 Groq는 훌륭한 선택이고, 시간이 얼마나 걸리든 가장 뛰어난 모델이 필요할 때는 적합하지 않습니다.
LPU 기반 추론 하드웨어: LPU(Language Processing Unit)는 학습이 아니라 추론을 위해 설계된 Groq 자체 실리콘입니다. 공식 수치로 랙당 LPU 256개, SRAM 대역폭 40 PB/s, 랙당 온칩 SRAM 128 GB, FP8 추론 연산 315 PFLOPS, 사용자당 초당 1,000토큰을 제시합니다. 아키텍처의 핵심 베팅은 모델 가중치를 외부 메모리에서 스트리밍하지 않고 빠른 온칩 메모리에 두는 것이 GPU 서빙이 부딪히는 지연 시간의 하한을 없애준다는 데 있습니다.
OpenAI 호환 API: 마이그레이션은 의도적으로 사소하게 설계되었습니다. base URL과 키만 바꾸면 쓰던 OpenAI 클라이언트 라이브러리를 그대로 유지한 채 다른 하드웨어에서 애플리케이션이 돌아갑니다. Groq는 자체 Python 및 TypeScript SDK도 제공합니다. 원래 OpenAI를 대상으로 작성된 프로젝트에서 Groq가 "주소만 바꾸는 속도 업그레이드"로 자주 등장하는 이유가 바로 이 설계 결정입니다.
오픈 웨이트 모델 카탈로그: 프로덕션 카탈로그는 오픈 웨이트 모델을 중심으로 구성됩니다. 텍스트는 openai/gpt-oss-120b와 openai/gpt-oss-20b, 음성은 whisper-large-v3와 whisper-large-v3-turbo입니다. 프리뷰 슬롯에는 Qwen3.6 27B, 콘텐츠 검열용 GPT-OSS Safeguard, 프롬프트 주입 탐지용 Llama Prompt Guard, Orpheus 음성 합성 같은 더 새롭거나 특화된 모델이 들어갑니다. 문서에는 모델마다 속도, 단가, 속도 제한, 컨텍스트 윈도, 최대 완성 길이가 명시되어 있어 코드를 쓰기 전에 비용을 계산할 수 있습니다.
Compound: 모델과 내장 도구의 결합: 순수 모델 엔드포인트 외에 Groq는 시스템이라 부르는 것을 제공합니다. Groq Compound는 공개된 모델로 구동되는 AI 시스템으로, 웹 검색과 코드 실행을 포함한 내장 도구를 선별적으로 사용해 질의에 답합니다. Compound와 Compound Mini는 초당 약 450토큰, 컨텍스트 윈도 131,072토큰으로 동작하며, 도구 호출 루프를 직접 만들지 않고도 에이전트 동작을 얻게 해줍니다.
독립 제품 라인으로서의 음성 인식: 여기서 Whisper는 부가 기능이 아닙니다. 토큰이 아닌 오디오 시간 단위의 자체 과금 체계, 시간당·일당 오디오 초라는 자체 속도 제한 차원, 100 MB 파일 상한, 전용 전사 및 번역 엔드포인트를 갖추고 있습니다. 회의록, 통화 분석, 자막 파이프라인을 만드는 팀은 텍스트 생성까지 옮기지 않고 오디오 단계에만 Groq를 쓸 수 있습니다.
신뢰도 요구에 맞춘 서비스 계층: service_tier 파라미터 하나가 요청 스케줄링 방식을 결정합니다. on_demand는 기본값으로 평소의 Groq 속도를 주되 피크에 간헐적 대기가 있고, flex는 신뢰성을 내주고 여유를 얻습니다. 동일 가격에 열 배 속도 제한이지만 최선 노력 방식입니다. performance는 지연에 민감한 프로덕션을 위한 엔터프라이즈 계층이며, auto는 그 순간 사용 가능한 최적 계층을 골라줍니다.
엔터프라이즈 통제와 전용 용량: 플랫폼은 세 개의 층으로 판매됩니다. GroqMetal이 전용 베어메탈 인프라를, GroqCore가 그 위에 검증된 추론 스택을, GroqAssured가 다시 그 위에 엔터프라이즈급 거버넌스와 감사 가능성, 통제를 얹으며 각 층은 아래 층을 포함합니다. 이 구조 덕분에 기업은 공용 API로 시작해 통합 방식을 바꾸지 않고 전용 용량으로 옮겨갈 수 있습니다.
글로벌 인프라: Groq는 네 개 대륙에 13개 데이터센터를 운영합니다. Liberty Lake와 Dallas부터 Vantaa, 시드니, 런던, 리야드까지 이어지며 캐나다와 사우디아라비아 거점도 포함됩니다. 지연에 민감한 애플리케이션에서는 사용자와의 물리적 거리가 칩 속도만큼 중요합니다.
실시간 대화형 인터페이스: 사용자가 글자가 나타나는 것을 지켜보는 상황에서 초당 50토큰과 500토큰의 차이는 기다림과 읽기의 차이입니다. 고객 지원 어시스턴트, 제품 내 코파일럿, 음성 에이전트가 가장 잘 맞습니다. 체감 응답성이 곧 기능이기 때문입니다. Groq의 빠른 소형 모델로 단순한 질의 90퍼센트를 처리하고 나머지는 더 강력한 모델로 에스컬레이션하는 구성이 흔히 쓰입니다.
에이전트 루프와 도구 호출 체인: 계획하고 도구를 부르고 결과를 읽고 다시 계획하는 에이전트는 지연 시간에 단계 수를 곱합니다. 단계당 2초인 5단계 체인은 10초 대기이지만, 단계당 300밀리초라면 즉각적으로 느껴집니다. 빠른 추론의 복리 효과가 가장 극적으로 드러나는 지점이며, Groq가 단발 생성보다 코딩 에이전트와 워크플로 자동화의 밑단에서 자주 쓰이는 이유입니다.
대량 텍스트 처리와 분류: 밀린 문서 요약, 지원 티켓 태깅, 수만 건 레코드에서 구조화 필드 추출 같은 작업은 단일 요청 지연보다 처리량과 단위 비용을 중시합니다. flex 계층이 정확히 이런 형태의 작업을 위해 존재하며, 동일한 토큰 단가로 표준 대비 열 배 속도 제한을 제공합니다. 지연 창을 감내할 수 있는 작업은 배치 처리로 보낼 수 있습니다.
전사와 오디오 파이프라인: Groq의 Whisper는 회의 녹음, 팟캐스트 아카이브, 콜센터 오디오, 자막 생성을 처리하며 토큰이 아닌 오디오 시간 단위로 과금합니다. 전사와 텍스트 생성이 같은 API와 같은 키를 쓰기 때문에, 통화를 전사한 뒤 요약하는 파이프라인은 벤더 관계 하나만 유지하면 됩니다.
프로토타이핑과 비용 통제형 실험: 무료 계층은 신용카드 없이 낮은 속도 제한으로 모델 카탈로그에 접근하게 해주므로, 해커톤 프로젝트, 사이드 프로젝트, 내부 데모의 첫 기착지가 되는 경우가 많습니다. 결제 수단을 추가하면 구독 약정 없이 한도가 올라가므로 플랫폼 평가 비용이 실제 사용량 안에서 제한됩니다.
기존 OpenAI 애플리케이션의 이전: API가 클라이언트 라이브러리 수준에서 호환되기 때문에, 팀들은 Groq를 확정된 선택이 아니라 벤치마크로 쓰는 경우가 많습니다. 설정 두 줄만 바꿔 같은 프롬프트를 양쪽에 보내고 지연, 비용, 출력 품질을 비교하는 식입니다. 일부 워크로드는 완전히 이전하고, 일부는 작업 유형별로 나뉜 채 남습니다.
Groq 콘솔에서 계정을 만듭니다. 이메일 인증을 마치면 조직(organisation)에 소속됩니다. 할당량이 사용자별이 아니라 조직 단위로 집계되므로 이 점이 중요합니다.
API 키를 발급합니다. 콘솔에서 키를 만들고 GROQ_API_KEY 같은 환경 변수로 저장하세요. 소스 관리에 절대 커밋하면 안 됩니다. 이 키는 조직 계정의 실제 지출을 승인합니다.
클라이언트를 Groq로 향하게 합니다. 이미 OpenAI SDK를 쓰고 있다면 base_url을 https://api.groq.com/openai/v1로 설정하고 api_key에 Groq 키를 넣으면 됩니다. 새로 시작한다면 Python은 groq, TypeScript는 groq-sdk 패키지를 설치하세요. 첫 요청은 openai/gpt-oss-20b 같은 모델 ID로 보내는 평범한 chat completion 호출입니다.
작업에 맞는 모델을 고릅니다. 확정 전에 지원 모델 문서를 읽으세요. 모델별 초당 토큰 속도, 백만 토큰당 가격, 속도 제한, 컨텍스트 윈도, 최대 완성 토큰이 정리되어 있습니다. 출시할 제품에는 반드시 프로덕션 모델을 쓰세요. 프리뷰 모델은 평가용이며 짧은 통보만으로 중단될 수 있습니다.
서비스 계층을 정하고 속도 제한을 처리합니다. 기본 온디맨드 동작을 원하면 service_tier를 비워두고, 유료 전환 후 고처리량 배치성 작업에는 flex를 지정하세요. x-ratelimit-remaining-tokens와 x-ratelimit-remaining-requests 응답 헤더를 읽고, HTTP 429와 flex의 HTTP 498에 지터를 넣은 백오프 재시도를 구현하세요.
확장 전에 과금 통제를 먼저 걸어둡니다. 결제 수단을 연결해 무료 한도를 풀고, 콘솔에서 지출 한도와 사용량 알림을 설정하세요. 추정이 가장 부정확한 프로덕션 첫 주에는 Dashboard → Usage에서 소비를 주시해야 합니다.
가장 큰 모델을 기본값으로 삼지 말고 작업에 맞추세요. Groq에서는 작은 모델이 확연히 빠르고 저렴하며, 분류·추출·라우팅·짧은 생성에서는 품질 차이가 사용자 눈에 보이지 않는 경우가 많습니다. 큰 모델이 필요하다고 단정하기 전에 자신의 프롬프트로 gpt-oss-20b와 gpt-oss-120b를 비교해 보세요. 속도 차이는 대략 두 배입니다.
첫날부터 모델 지원 종료를 전제로 설계하세요. Groq의 카탈로그는 회전이 빠릅니다. 모델 ID를 하드코딩하지 말고 설정에서 읽어오고, 지원 종료 페이지를 주시하며, 계정 이메일이 실제로 마이그레이션 공지를 처리할 사람에게 닿는지 확인하세요. 코드를 신속히 재배포할 수 없다면 사라진 모델 ID는 곧 장애입니다.
API 키를 더 만들어 한도를 늘리려 하지 마세요. 속도 제한은 사용자나 키가 아니라 조직 단위로 적용되므로 키를 추가해도 상한은 그대로입니다. 더 많은 처리량이 필요하면 결제 수단을 추가하거나 flex 계층으로 옮기거나 영업을 통해 전용 용량을 협의하세요.
첫 토큰 지연과 전체 지연을 분리해 계측하세요. Groq의 강점은 양쪽 모두에 나타나지만 원인은 다릅니다. 첫 토큰이 느리면 대개 대기열이나 먼 리전 문제이고, 완성이 느리면 대개 필요 이상으로 생성하고 있다는 뜻입니다. max_tokens를 과감히 제한하세요. 어떤 하드웨어에서든 짧은 답이 빠릅니다.
프롬프트 캐싱을 활용하고 시스템 프롬프트를 안정적으로 유지하세요. 캐시된 토큰은 속도 제한에 포함되지 않으므로, 요청 간 시스템 프롬프트를 일정하게 유지하면 비용이 내려가는 동시에 실효 처리량을 얻습니다. 매 호출마다 시스템 프롬프트를 다시 쓰면 이 이득을 버리는 셈입니다.
재시도를 제대로 구현하세요. 특히 flex에서. flex 계층은 명시적으로 최선 노력 방식입니다. 용량 부족 실패는 예상된 일이고 빠르게 돌아오며 재시도해도 안전합니다. 여기서 지터를 넣은 지수 백오프는 선택이 아닙니다. HTTP 498은 사용자에게 노출할 오류가 아니라 "잠시 뒤 재시도"로 다뤄야 합니다.
민감한 데이터를 보내기 전에 제로 데이터 보존을 켜세요. ZDR은 모든 고객이 쓸 수 있지만 기본값이 아니며, 활성화하면 영속성에 의존하는 기능이 함께 비활성화됩니다. 이 맞교환은 첫 프로덕션 요청 이후가 아니라 그 전에 결정해야 합니다.
다른 사업자로 갈 수 있는 경로를 남겨두세요. API가 양방향으로 OpenAI와 호환되므로, 같은 인터페이스 뒤에 두 번째 사업자를 설정해두는 비용은 크지 않으면서 용량 이슈, 지원 종료, 가격 변경으로부터 보호해 줍니다.
지연에 민감한 AI 기능을 만드는 애플리케이션 개발자: 사용자가 글자가 나타나는 것을 지켜보는 제품(채팅 인터페이스, 코파일럿, 음성 제품)이라면 속도가 곧 체감 품질로 바뀌므로 이득이 가장 직접적입니다.
에이전트와 다단계 워크플로를 만드는 팀: 지연이 단계마다 곱해질 때, 빠른 추론의 가치는 단일 요청 벤치마크가 보여주는 것보다 훨씬 큽니다. 에이전트 프레임워크, 코딩 어시스턴트, 자동화 파이프라인이 자연스러운 대상입니다.
이미 OpenAI SDK에 투자한 엔지니어: 코드베이스가 OpenAI 클라이언트 라이브러리 기준으로 작성돼 있다면 Groq 평가는 재작성이 아니라 설정 변경이면 끝납니다. 이 낮은 전환 비용이 플랫폼의 가장 효과적인 유입 경로입니다.
단순 작업을 대량으로 돌리는 비용 민감 팀: 대규모 분류, 태깅, 추출, 요약은 독점 프론티어 모델보다 오픈 웨이트 소형 모델에서 훨씬 저렴하며, 토큰 단위 과금 덕분에 계산이 단순합니다.
스타트업과 프로토타이퍼: 신용카드 없는 무료 계층과 구독 하한 없는 종량제는 시작하기도 쉽고 접기도 쉽게 만듭니다. 초기 팀이 원하는 조건이 정확히 이것입니다.
지연, 거버넌스, 데이터 소재지 요건이 있는 기업: GroqAssured, performance 서비스 계층, 제로 데이터 보존, 전용 베어메탈 용량은 공용 최선 노력 엔드포인트에서 운영할 수 없는 조직을 위해 존재합니다.
오디오와 전사 제품을 만드는 팀: 오디오 시간당 과금되는 Whisper, 별도의 오디오 속도 제한, 번역 엔드포인트 덕분에 텍스트 생성에 Groq를 쓰는지와 무관하게 전사 벤더로만 채택할 수 있습니다.
https://api.groq.com/openai/v1에서 chat completions, Responses API, 오디오 전사·번역·합성, 배치, 파일, 파인튜닝 엔드포인트를 제공합니다.console.groq.com에서 계정 관리, API 키, 프로젝트, 모델 권한, 사용량 대시보드, 지출 한도, 데이터 컨트롤과 전체 문서 및 API 레퍼런스를 제공합니다.무료 계층. Groq는 신용카드가 필요 없는 무료 개발자 계층을 제공하며, 낮은 속도 제한으로 모델 카탈로그에 접근할 수 있습니다. 프로토타이핑, 사이드 프로젝트, 내부 데모, 저트래픽 기능에는 실제로 쓸 만하며, 대개 토큰보다 하루 요청 수 상한에 먼저 부딪힙니다. 구조적으로 중요한 점은 한도가 조직 단위로 집계되므로 키를 더 만들어 무료 계정을 넓힐 수 없다는 것입니다.
종량제. API 이용에 구독료는 없습니다. 텍스트 모델은 백만 토큰 단위로 입력과 출력을 나누어 과금합니다. 예를 들어 gpt-oss-120b는 백만 토큰당 입력 0.15달러, 출력 0.60달러이고 gpt-oss-20b는 0.075달러와 0.30달러입니다. 음성 인식은 오디오 시간당 과금되어 whisper-large-v3는 시간당 0.111달러, 터보 버전은 0.04달러입니다. 결제 수단을 추가하면 속도 제한이 크게 올라가고, 같은 토큰 단가로 더 높은 처리량을 주는 flex와 배치 처리 계층이 열립니다. 제3자 벤치마크 플랫폼 Artificial Analysis의 실측에 따르면 카탈로그 전반의 혼합 단가는 백만 토큰당 약 0.05~0.84달러로 모델 간 약 16배 차이가 납니다.
과금 방식. 청구는 처음에 누진식이고 이후 월 단위로 바뀝니다. 누적 사용량이 1, 10, 100, 500, 1,000달러 문턱을 처음 넘을 때 즉시 청구되며, 인도 고객은 다른 일정이 적용됩니다. 0.50달러 미만 청구서는 발행되지 않습니다. 콘솔에서 지출 한도와 예산 알림을 설정할 수 있고 사용량은 거의 실시간으로 확인됩니다.
엔터프라이즈. 약정 지출 계약, performance 서비스 계층, 전용 GroqMetal 용량, GroqAssured 거버넌스 계층은 셀프서비스가 아니라 영업을 통해 판매됩니다. 엔터프라이즈 계약에는 용량 외의 실질적 이점도 있습니다. 무료 및 개발자 계층에 적용되는 모델 지원 종료가 약정 지출 고객에게는 면제됩니다. 카탈로그와 가격이 자주 바뀌므로 정확한 조건과 현재 요율은 공식 문서와 콘솔에서 확인하시기 바랍니다.
모델 카탈로그의 교체가 매우 공격적입니다. 실무적으로 가장 큰 위험입니다. Groq 자체 지원 종료 페이지에는 끊임없는 퇴역 기록이 남아 있습니다. llama-3.1-8b-instant와 llama-3.3-70b-versatile은 2026년 8월 16일에 함께 퇴역했고, qwen3-32b와 llama-4-scout은 한 달 앞서, 그 전에는 Kimi K2와 Llama 4 Maverick이 제거되었습니다. 지원 종료는 무료 및 개발자 계층에 적용되고 약정 지출 엔터프라이즈 고객은 면제되므로, 보호를 가장 적게 받는 사용자가 교체 비용을 가장 많이 떠안습니다. 프리뷰 모델에는 짧은 통보만으로 중단될 수 있다는 명시적 경고가 붙어 있습니다.
OpenAI 호환은 근접할 뿐 완전하지 않습니다. OpenAI 대상 코드에 흔한 여러 파라미터가 그대로 실패합니다. logprobs, logit_bias, top_logprobs, messages[].name은 모두 400 오류를 반환하고 n은 1이어야 합니다. 오디오 전사는 vtt와 srt를 내보내지 않고, temperature 0은 조용히 1e-8로 바뀝니다. 일반적인 경우 마이그레이션은 쉽지만 가장자리에서 깨질 수 있으니 가정하지 말고 검증하세요.
역량은 오픈 웨이트 카탈로그에 의해 제한됩니다. 속도는 진짜이지만 그것은 중형 오픈 모델에서의 속도입니다. Artificial Analysis의 독립 벤치마크에서 추적 중인 11개 Groq 모델 가운데 지능 지수가 가장 높은 것은 38점의 Qwen3.6 27B로, 독점 프론티어 모델에 한참 못 미칩니다. 가장 어려운 추론, 장기 코딩, 결이 섬세한 글쓰기에서는 느리더라도 프론티어 모델이 더 나은 결과를 낼 수 있습니다.
속도 제한은 조직 단위이며 다차원입니다. 분당 요청, 일당 요청, 분당 토큰, 일당 토큰, 오디오 초가 동시에 적용되고 가장 먼저 걸리는 축에 의해 제한됩니다. 작은 요청을 많이 보내는 패턴은 토큰 한도를 거의 쓰지 않고도 RPM을 소진할 수 있습니다. 일부 조직에는 입력과 출력 토큰 제한이 별도로 걸립니다.
flex 계층은 명시적으로 최선 노력 방식입니다. 같은 가격에 열 배 속도 제한을 주지만 용량이 없으면 HTTP 498과 capacity_exceeded 오류로 실패합니다. 결함이 아니라 의도된 설계이며, 따라서 대체 경로 없이 사용자 대면 경로에 flex를 두는 것은 부적절합니다.
데이터 소재지는 미국으로 고정되어 있습니다. 추론 요청은 기본적으로 보존되지 않고 제로 데이터 보존을 모든 고객이 쓸 수 있지만, 보존되는 데이터는 미국에 위치한 Google Cloud Platform 버킷에 저장되며 국경 간 이전에는 표준 계약 조항이 적용됩니다. 엄격한 EU 또는 아시아태평양 소재지 요건이 있는 조직은 자체 컴플라이언스 의무와 대조해 확인해야 하며, ZDR을 켜면 배치 작업이나 파인튜닝처럼 영속성에 의존하는 기능이 비활성화된다는 점도 유의해야 합니다.
회사 차원의 최근 변동이 컸습니다. 2025년 12월 DataCenterDynamics는 창업자 Jonathan Ross와 사장 Sunny Madra가 비독점 기술 라이선스 계약에 따라 NVIDIA로 이동했고, Groq는 Simon Edwards 체제에서 독립 기업으로 계속 운영되며 GroqCloud는 중단 없이 돌아간다고 보도했습니다. 거래 규모에 대한 보도는 일관되지 않았습니다. 널리 인용되는 200억 달러 수치는 독립적으로 검증되지 않았고 비독점 라이선스의 조건은 공개된 적이 없습니다. 2026년 8월 시리즈 A는 회사 가치를 35억 달러로 평가했는데, 이는 2025년 9월 조달 당시 69억 달러의 절반 수준입니다. 서비스 연속성은 내내 유지되었지만, 다년 인프라 약정을 검토하는 팀이라면 기술과 함께 소유 구조 및 리더십 변화도 함께 저울질해야 합니다.
독립적인 사용자 평가 데이터가 얇습니다. Groq는 언론 보도는 풍부하지만 정형화된 리뷰 플랫폼 피드백은 매우 적습니다. G2 등록 항목의 리뷰 수는 무시할 만한 수준이고, 제3자 디렉터리는 Groq를 소비자용 챗봇이 아니라 AI API, 대규모 언어 모델, 오픈소스 AI 모델로 분류하지만 여기서도 의미 있는 리뷰 물량은 없습니다. 현재 확보 가능한 가장 강한 독립 증거는 사용자 증언이 아니라 벤치마크 데이터이므로, 고객 지원 품질이나 장기 신뢰성에 관한 주장은 미검증으로 간주해야 합니다.
Grok과 혼동하지 마세요. Groq(groq.com)는 Groq LLC의 추론 인프라이고, Grok(grok.com)은 일론 머스크의 xAI가 만든 소비자용 채팅 어시스턴트입니다. 이름은 글자 하나의 순서만 다르지만 제품은 공통점이 없습니다. 회사도, 대상 사용자도, 수익 모델도 다릅니다.
네. 신용카드 없이 이용 가능한 무료 개발자 계층이 있어 낮은 속도 제한으로 모델 카탈로그에 접근할 수 있으며, 프로토타이핑과 저트래픽 프로젝트에는 충분합니다. 결제 수단을 추가하면 한도가 크게 올라가고 flex와 배치 계층이 열립니다. 구독료는 없고 토큰 사용량 과금만 있습니다.
철자가 거의 같아 자주 혼동되지만 서로 무관한 제품입니다. groq.com의 Groq는 LPU 하드웨어 위에 구축되어 개발자에게 API로 판매되는 AI 추론 클라우드이고, grok.com의 Grok은 xAI의 소비자용 채팅 어시스턴트입니다. 회사도 제품도 과금 모델도 다릅니다.
대부분 가능하며 두 가지만 바꾸면 됩니다. base URL을 https://api.groq.com/openai/v1로 설정하고 Groq API 키를 넣는 것입니다. 다만 logprobs, logit_bias, top_logprobs, messages[].name은 지원되지 않아 400 오류를 반환하고 n은 1이어야 하므로, 깨끗한 교체를 가정하지 말고 자신의 호출 패턴을 검증하세요.
Groq는 독점 프론티어 모델이 아니라 오픈 웨이트 모델을 제공합니다. 프로덕션 카탈로그는 텍스트의 openai/gpt-oss-120b와 openai/gpt-oss-20b, 음성의 whisper-large-v3와 터보 버전을 중심으로 하며, 프리뷰에는 Qwen3.6 27B, 안전 분류기, Orpheus 음성 합성 등이 들어갑니다. 현재 목록은 모델 문서와 /openai/v1/models 엔드포인트에서 언제든 확인할 수 있습니다.
Artificial Analysis의 독립 벤치마크 기준으로 Groq에서 가장 빠른 모델은 높은 추론 강도의 gpt-oss-20b로 중앙값 초당 949토큰이며, 첫 토큰까지의 최소 시간은 약 0.77초입니다. Groq 자체 하드웨어 수치는 사용자당 최대 초당 1,000토큰을 제시합니다. 실제 처리량은 모델, 프롬프트 길이, 서비스 계층, 부하에 따라 달라집니다.
Groq는 추론 요청에 대해 고객 데이터를 기본적으로 보존하지 않는다고 명시합니다. 배치 작업이나 파인튜닝처럼 영속성이 필요한 기능, 또는 신뢰성 문제 해결과 남용 조사를 위한 일시적 기록에 한해 보존되며 후자는 최대 30일입니다. 모든 고객이 제로 데이터 보존을 켤 수 있으나, 켜면 영속성에 의존하는 기능은 비활성화됩니다.
추론은 네 개 대륙 13개 데이터센터에서 실행되지만, 보존되는 고객 데이터는 미국에 위치한 Google Cloud Platform 버킷에 저장되며 해당되는 경우 표준 계약 조항이 이전을 규율합니다. 엄격한 지역 소재지 요건이 있는 조직은 자체 규정과 대조해 확인해야 합니다.
아니요. 속도 제한은 조직 단위로 적용되므로 추가 키는 같은 할당량을 공유합니다. 여유가 더 필요하면 결제 수단을 추가해 개발자 계층 한도로 올리거나, 고처리량 작업에 flex 계층을 쓰거나, 영업을 통해 전용 용량을 마련하세요.
텍스트 모델은 토큰 단위, 전사는 오디오 시간 단위로 과금되며 구독 요소는 없습니다. 초기에는 누진식이라 누적 사용량이 1, 10, 100, 500, 1,000달러를 넘을 때 청구되고 이후에는 순수 월 단위로 바뀝니다. 0.50달러 미만은 청구서가 발행되지 않으며 콘솔에서 지출 한도와 예산 알림을 설정할 수 있습니다.
GroqCloud는 NVIDIA 라이선스 계약, 창업자의 이탈, 리더십 교체 같은 중대한 변화 속에서도 중단 없이 운영되었고, 회사는 2026년 8월 35억 달러 가치로 3억 5천만 달러 시리즈 A를 유치했습니다. 실질적 위험은 회사의 소멸보다 모델 교체 쪽입니다. 모델 ID를 설정 가능하게 만들고 지원 종료 공지를 주시하며 같은 인터페이스 뒤에 두 번째 사업자를 준비해 두세요.