Cerebras는 자체 개발한 웨이퍼 스케일 프로세서에서 오픈 웨이트 언어 모델을 실행하는 AI 추론 플랫폼입니다. 개발자는 브라우저 Playground가 딸린 클라우드 API인 Cerebras Inference로 이용하며, 규모가 큰 조직은 Dedicated 전용 용량을 예약하거나 자체 데이터센터에 Cerebras 시스템을 설치할 수 있습니다. 같은 하드웨어가 학습과 파인튜닝 서비스도 뒷받침합니다.
퍼블릭 클라우드 티어는 정기적으로 갱신되는 모델 라인업을 공유 엔드포인트에서 제공하며, API 키로 호출합니다.
핵심 셀링 포인트는 속도입니다. Cerebras는 최신 랙 스케일 시스템인 CS-4가 GPU보다 최대 30배 빠른 추론을 제공한다고 소개하는데, 이는 독립 측정이 아닌 업체 수치입니다.
제품을 만든 Cerebras Systems는 2026년 5월 IPO에서 55억 달러를 조달했고, 독립 비즈니스 보도는 OpenAI, G42, Mohamed bin Zayed University of Artificial Intelligence, Amazon Web Services를 고객으로 꼽습니다.
모델 충실도는 보기 드물 만큼 자세히 문서화되어 있습니다. Cerebras는 Shared Inference의 모든 모델이 가지치기하지 않은 원본 버전이라고 밝힙니다. 가중치는 선택적 가중치 전용 양자화로 일부 16, 8 또는 4비트 형식에 저장되고, 민감한 레이어는 완전 정밀도를 유지하며, 활성화값·어텐션·KV 캐시는 양자화하지 않습니다. 빠른 AI 추론 업체를 비교하는 사람에게는 속도 수치 뒤에서 실제로 무엇이 제공되는지 알려 주는 정보입니다.
프롬프트 캐싱은 지원되는 모든 API 요청에서 자동으로 작동하며, 캐시 브레이크포인트나 코드 변경이 필요 없습니다. Cerebras는 캐시 TTL 5분을 보장하고, 시스템 부하에 따라 항목이 최대 1시간까지 유지될 수 있습니다. 이점은 가격이 아니라 용량입니다. 캐시된 토큰은 비캐시 속도 제한에서 제외되지만 할인되지는 않습니다.
Dedicated Inference는 단일 조직을 위해 용량을 예약하며, 예측 가능한 성능이 필요한 프로덕션 작업에 Cerebras가 제시하는 옵션입니다. 표준 모델 버전과 함께 파인튜닝한 가중치를 배포할 수도 있습니다. 배포마다 용량, 드래프트 모델, 모델 구성, 양자화를 조정할 수 있고, Shared Inference의 모든 기능 위에 파인튜닝, 가중치 관리, 서비스 티어 제어가 더해집니다. 전용 쪽에서 지원하는 모델 계열은 Qwen 3.8, Qwen3와 Qwen3-Coder, Llama 3와 Llama 4, GLM 4.X와 5.X, Kimi K2.X, DeepSeek V3.X입니다.
Batch API는 요청 묶음을 비동기로 처리하며, 배치 요청은 24시간 이내 완료가 보장됩니다.
Cerebras Code는 사용자 자신의 에디터에서 쓰도록 만든 코딩 구독 상품입니다. 제품 페이지는 GLM 4.7로 코드를 초당 1,000토큰 이상 생성한다고 하지만, API 지원 중단 로그의 내용은 다릅니다.
Cerebras Training Cloud는 같은 간단한 코드로 10억에서 수십조 개 파라미터 규모의 모델을 학습하고 파인튜닝하는 방법으로 소개됩니다.
CS-4 시스템은 WSE-3 Turbo 프로세서로 구동되며, Cerebras는 이 프로세서가 트랜지스터 4조 개와 AI 코어 90만 개를 갖추고 250 PFLOPS 연산 성능과 초당 43.2페타바이트의 메모리 대역폭을 낸다고 설명합니다. CS-4 페이지는 이번 분기에 첫 출하가 시작된다고 하지만 날짜는 밝히지 않습니다.
Cerebras는 토큰을 기다리는 시간이 제품에 손해가 되는 워크로드를 중심으로 활용 사례를 제시합니다.
가장 눈에 띄는 배포 사례는 외부에 있습니다. 2026년 2월 독립 기술 매체들은 더 빠른 추론과 실시간 협업을 위해 설계된 소형 Codex 모델인 OpenAI의 GPT-5.3-Codex-Spark가 Cerebras의 Wafer Scale Engine 3에서 실행된다고 보도했습니다.
Cerebras는 응답 속도가 제품을 바꾸는 팀에 맞지만, 알맞은 진입점은 단계에 따라 다릅니다.
지원도 티어마다 다릅니다. Developer 계정은 커뮤니티 Discord에 의존하고, Enterprise 고객에게는 전담 계정 팀이 붙습니다.
영구 무료 티어, 셀프서비스 엔드포인트의 매우 긴 컨텍스트 창, 폭넓은 셀프서비스 모델 선택지를 기대한다면 잘 맞지 않습니다. 자세한 내용은 가격, 제한 사항, 기능 섹션에 있습니다.
Cerebras API 가격은 셀프서비스 Developer 티어의 경우 종량제이며 무료 $5 크레딧으로 시작하고, Enterprise 가격은 문의 시 견적을 받습니다.
| 모델(Developer 티어) | 입력 | 출력 |
|---|---|---|
| GPT OSS 120B | $0.35/100만 토큰 | $0.75/100만 토큰 |
| Qwen 3.8 27B | $0.99/100만 토큰 | $1.49/100만 토큰 |
Cerebras Code Pro는 하루 최대 2,400만 토큰에 $50로 표시되며 인디 개발자와 주말 프로젝트를 겨냥합니다. Cerebras Code Max는 하루 최대 1억 2,000만 토큰에 $200로 표시되며 풀타임 개발과 멀티 에이전트 시스템을 겨냥합니다. 2026년 10월 4일 수집 시점에 두 유료 플랜 모두 품절로 표시되었고, 이 페이지를 위해 확인한 플랜 카드에는 결제 주기가 적혀 있지 않습니다.
Training Cloud는 시간 단위로 판매되거나(제출한 워크로드에 필요한 시간을 Cerebras가 산정), 모델 단위로 판매됩니다(Cerebras 전문가가 사용자의 데이터셋으로 모델을 설계하고 파인튜닝). Training Cloud 페이지에는 이 옵션들이 요금 없이 나와 있습니다.
표준 GPU를 빌리는 대신 빠른 추론용 맞춤 실리콘을 만드는 업체는 더 있습니다.
이들과 비교하면 Cerebras는 웨이퍼 스케일 프로세서, $5 셀프서비스 체험이 딸린 OpenAI 호환 API, CS-4 시스템을 온프레미스에 설치하는 옵션이 돋보이지만, 셀프서비스 카탈로그는 모델 두 개로 제한됩니다.
사용자 보고도 같은 방향을 가리킵니다. Cerebras의 Qwen 3.8 27B 출시를 다룬 공개 개발자 토론에서 여러 개발자는 Cerebras가 허용하는 128k 컨텍스트가 긴 에이전트 작업이나 코딩 작업에는 너무 작다고 했습니다. 같은 스레드의 다른 사용자들은 퍼블릭 엔드포인트의 15만 TPM 한도 때문에 많은 코딩 작업에 이 모델을 쓰기 어렵다고 했습니다. Cerebras Code가 Qwen3 Coder를 실행하던 2025년 9월에 쓰인 한 IT 매체 오피니언 칼럼은, 생성이 10~20초 동안 매우 빠르게 진행되다가 분당 토큰 한도에 걸려 해당 분이 재설정될 때까지 429 오류가 났다고 전했습니다.
Cerebras는 자사 성능 비교가 서드파티 벤치마크나 내부 테스트에 근거하며, GPU 시스템 대비 관측된 속도 향상은 워크로드, 구성, 날짜, 모델에 따라 달라질 수 있다고 밝힙니다.
API와 Playground 접근은 멈추지만 API 키, 프로젝트, 설정은 그대로 유지되며, 종량제 크레딧을 구매하면 Developer 티어에서 접근이 다시 활성화됩니다. Developer 티어에는 시간당·일당 토큰 상한이 없습니다.
Cerebras는 기존 모델 ID에 대해 수정 없는 원본 가중치를 제공하며, 향후 가지치기 변형이 나오면 별도의 모델 ID로 출시하겠다고 밝힙니다.
네. OpenAI 호환 model 필드에는 Shared Inference에서는 정확한 모델 ID를, Dedicated Inference에서는 안정적인 엔드포인트 ID를 넣으며, 엔드포인트 ID는 각 요청을 현재 활성화된 배포로 라우팅합니다.