Fireworks(문서에서는 Fireworks AI로 표기)는 오픈 AI 모델을 실행하고 학습시키는 클라우드 플랫폼입니다. 개발자는 LLM 추론 API로 호스팅된 모델을 호출하거나, 자체 배포용 전용 GPU를 임대하거나, 자체 데이터로 오픈 모델을 파인튜닝한 뒤 같은 인프라에서 그 결과물을 서빙할 수 있습니다.
벤더는 이 플랫폼을 '전문화된 지능을 위한 기반 인프라'로 내세우며, 선도적인 오픈소스 모델과 고객 데이터를 반복할 때마다 더 날카로워지는 우위로 바꾸는, 고객이 소유하는 학습 루프라고 설명합니다. Fireworks는 파운데이션 모델을 처음부터 만들지 않습니다. 공동 창업자이자 CEO인 린 차오는 기업이 특정 요구에 맞게 기존 모델을 파인튜닝하도록 돕는 사업이라고 설명한 바 있습니다. 린 차오는 이전에 Meta에서 AI 플랫폼 개발팀을 이끌었습니다.
규모를 보면, 독립 기술 매체는 2026년 9월에 Fireworks가 7월 연환산 매출 10억 달러 달성을 발표했으며 이는 전년의 5배라고 보도했습니다.
이러한 옵션 덕분에 오픈 모델 파인튜닝은 별도 제품이 아니라 서빙으로 이어지는 파이프라인이 됩니다. 홈페이지에 따르면 모든 체크포인트는 몇 초 만에 프로덕션에 배포됩니다.
일반적인 첫 프로젝트는 서버리스 테스트에서 비용 관리로 넘어갑니다.
firectl quota list를 실행해 계정의 현재 속도 제한, GPU 할당량, 지출 한도, 사용량을 확인합니다.Fireworks 홈페이지의 고객 인용문은 독립적인 사례 연구가 아니라 벤더가 고른 추천사이지만, 플랫폼이 겨냥하는 워크로드를 보여 줍니다.
두 가지 경우에는 덜 적합합니다. 고정된 모델 버전이 필요한 팀은 서버리스에서 얻는 이점이 적습니다. 서버리스 모델은 Fireworks 팀이 관리하며 새 모델이 출시되면 업데이트되거나 지원 중단될 수 있기 때문입니다. 약관상 미성년자의 사용은 부모나 법정 후견인이 감독하지 않는 한 금지됩니다.
결제는 선불입니다. 자동 충전 기능으로 잔액을 자동으로 채울 수 있고 월 지출 한도로 사용량에 상한을 둘 수 있습니다. 계약 고객은 후불 결제로 전환하는 옵션을 받을 수도 있습니다.
가격은 100만 토큰당 USD 기준이며 입력 / 캐시된 입력 / 출력 순으로 표시되고, 2026년 10월 5일에 수집되었습니다.
| 모델 | Standard | Priority |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
개별 표시되지 않은 텍스트 및 비전 모델은 크기별로 가격이 매겨집니다. 파라미터 4B 미만은 $0.10, 4B~16B는 $0.20, 16B 초과는 $0.90(모두 1M 토큰당)이며 별도의 캐시 요금은 없습니다. 배치 추론은 입력과 출력 모두 서버리스 가격의 50%로 청구됩니다. 2026년 9월 1일부터 출시된 미국 전용 모델은 베이스 모델 서버리스 가격의 1.5배로 책정됩니다.
온디맨드 배포는 GPU 초 단위로 청구되며 시작 시간에 대한 추가 요금은 없습니다.
| GPU | 분당 | 시간당 |
|---|---|---|
| H100 80 GB | $0.134 | $8.00 |
| H200 141 GB | $0.134 | $8.00 |
| B200 180 GB | $0.217 | $13.00 |
| B300 288 GB | $0.250 | $15.00 |
| GB300 288 GB | $0.334 | $20.00 |
리전 제한 배포에는 1.5배 프리미엄 가격이 적용되며 영업팀을 통해 진행됩니다.
관리형 지도 파인튜닝과 선호도 파인튜닝은 학습 토큰 1M당 가격이 매겨집니다.
| 베이스 모델 크기 | LoRA SFT | LoRA DPO | 전체 파라미터 SFT | 전체 파라미터 DPO |
|---|---|---|---|---|
| 16B 이하 | $0.50 | $1.00 | $1.00 | $2.00 |
| 16.1B~80B | $3.00 | $6.00 | $6.00 | $12.00 |
| 80B~300B | $6.00 | $12.00 | $12.00 | $24.00 |
| 300B 초과 | $10.00 | $20.00 | $20.00 | $40.00 |
학습 토큰은 학습 데이터셋의 토큰 수에 에폭 수를 곱해 추정합니다. Dedicated Training API 작업은 온디맨드 요금 기준으로 GPU 시간당 가격이 매겨집니다.
서빙 비용은 페이지마다 다르게 읽힙니다. 가격 페이지는 파인튜닝된 모델을 베이스 모델과 같은 가격으로 서빙할 수 있다고 하는 반면, 결제 FAQ는 학습된 LoRA 모델을 서빙하려면 전용 배포가 필요하며 GPU 초 단위로 청구된다고 설명합니다.
Fireworks는 전용 GPU를 초 단위로 청구하는 반면 Baseten은 분 단위로 계량하며, 이 차이는 짧고 순간적으로 몰리는 배포에서 가장 크게 드러납니다.
기본적으로 Fireworks는 사용자의 명시적 옵트인 없이 어떤 오픈 모델에 대해서도 프롬프트나 생성 데이터를 기록하거나 저장하지 않습니다. 다만 토큰 수와 같은 요청 메타데이터는 기록합니다. 프롬프트 캐싱이 활성화되면 일부 프롬프트 데이터가 휘발성 메모리에 몇 분간 남을 수 있습니다.
Response API는 예외입니다. 기본적으로 대화를 저장하며, 저장된 대화 데이터는 30일 후 자동 삭제됩니다. 약관은 또한 데이터 무보존 약속을 추론으로 한정하며, 학습, 파인튜닝, 에이전트 기능처럼 설계상 데이터를 보관하는 기능에는 적용되지 않습니다.
학습 사용에 대해서는 두 문서의 표현이 다릅니다. 서비스 약관은 Fireworks가 고객의 콘텐츠를 자사 모델 학습이나 서비스 개선에 사용하지 않는다고 말합니다. 개인정보 처리방침은 고객의 명시적 옵트인 없이는 프롬프트, 학습 데이터, API 입력을 모델 학습이나 개선에 사용하지 않는다고 말합니다. 당사자 간에는 고객이 콘텐츠에 대한 모든 권리, 소유권, 이익을 가지며, 약관은 콘텐츠를 고객의 입력과 출력으로 정의합니다.
엔터프라이즈 관리자는 계정 전체 데이터 무보존 정책을 켤 수 있습니다. 이 정책은 배치 추론 작업, 파인튜닝 및 RL 작업, 데이터셋 업로드, FireRouter 가상 모델을 포함해 고객 콘텐츠를 영구 저장하게 되는 모든 작업을 거부합니다. FireRouter가 턴을 Claude나 GPT로 보낼 때 해당 클로즈드 모델은 고객 자신의 Anthropic 또는 OpenAI 계정에서 실행됩니다.
다음은 독립 감사가 아닌 벤더의 진술입니다.
확인한 가격 페이지에는 무료 플랜이 보이지 않습니다. 결제 FAQ에 언급된 $1 크레딧 외에 계속 사용하려면 결제 수단과 선불 크레딧이 필요합니다.
아니요. LoRA 모델에는 GPU 시간으로 청구되는 온디맨드 배포가 필요하며, 하나의 배포에 최대 100개의 LoRA 어댑터를 호스팅해 그 비용을 분산할 수 있습니다.
서버리스 추론 가격은 토큰마다 청구되므로 유휴 시간에는 비용이 들지 않습니다. 온디맨드 배포는 높은 활용률에서 더 저렴하다고 설명되며, 토큰 단위가 아니라 GPU 초 단위로 청구됩니다.