Toolso.AI
Toolso.AI
모든 도구카테고리인기최신 도구가격블로그
Toolso.AI
Toolso.AI

💌AI 도구 위클리 구독

매주 선별된 최신 및 핫한 AI 도구와 트렌드를 받은편지함으로 받아보세요 구독

Toolso.AI
Toolso.AI

생산성을 높일 최고의 AI 도구 발견

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

인기 카테고리

  • AI 글쓰기
  • AI 이미지
  • AI 비디오
  • AI 코딩
  • 더 많은 카테고리

탐색

  • 최신 도구
  • 인기 도구
  • 더 많은 도구
  • 도구 제출
  • 요금

회사 소개

  • 회사 소개
  • 문의하기
  • 블로그
  • 변경 로그

법률

  • 쿠키 정책
  • 개인정보 보호정책
  • 서비스 약관
  • 환불 정책
© 2026 Toolso.AI 모든 권리 보유
기간 한정기간 한정 프로모션추천 등록24시간 우선 심사 · 백링크 불필요 · 30일 추천 노출$29.90이후 $59.9010월 31일 이후 $59.90로 인상종료까지--:--:--지금 제출
  1. 홈
  2. 모든 도구
  3. 개발 도구
  4. Fireworks
Fireworks 인터페이스 미리보기
Fireworks 로고

Fireworks

Fireworks는 토큰 단위로 과금되는 서버리스 API와 GPU 초 단위로 과금되는 전용 배포로 오픈 모델을 서빙하고, 관리형 파인튜닝을 더해 개발팀이 자체 모델 변형을 학습하고 호스팅할 수 있게 합니다.

개발 도구AI 개발AI 훈련 플랫폼#일괄 처리#LLM#OpenAI 호환 API
무료로 사용해보기
저장
방문 횟수
조회수
가격
무료
출시일
2026년 10월 5일
도메인
fireworks.ai
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

Fireworks 제품 정보

무료로 사용해보기
도구 정보
저장
방문 횟수
조회수
가격
무료
출시일
2026년 10월 5일
도메인
fireworks.ai
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

추천 도구

관련 도구

무료로 사용해보기

Fireworks, 어떤 도구인가요?

Fireworks(문서에서는 Fireworks AI로 표기)는 오픈 AI 모델을 실행하고 학습시키는 클라우드 플랫폼입니다. 개발자는 LLM 추론 API로 호스팅된 모델을 호출하거나, 자체 배포용 전용 GPU를 임대하거나, 자체 데이터로 오픈 모델을 파인튜닝한 뒤 같은 인프라에서 그 결과물을 서빙할 수 있습니다.

벤더는 이 플랫폼을 '전문화된 지능을 위한 기반 인프라'로 내세우며, 선도적인 오픈소스 모델과 고객 데이터를 반복할 때마다 더 날카로워지는 우위로 바꾸는, 고객이 소유하는 학습 루프라고 설명합니다. Fireworks는 파운데이션 모델을 처음부터 만들지 않습니다. 공동 창업자이자 CEO인 린 차오는 기업이 특정 요구에 맞게 기존 모델을 파인튜닝하도록 돕는 사업이라고 설명한 바 있습니다. 린 차오는 이전에 Meta에서 AI 플랫폼 개발팀을 이끌었습니다.

규모를 보면, 독립 기술 매체는 2026년 9월에 Fireworks가 7월 연환산 매출 10억 달러 달성을 발표했으며 이는 전년의 5배라고 보도했습니다.

핵심 기능

서버리스 추론

  • 토큰당 과금 이용: 서버리스는 토큰 단위로 과금되며 Priority와 Fast 옵션을 제공하고, API는 OpenAI 및 Anthropic 호환으로 설명됩니다.
  • Priority 모드: Priority 티어는 Standard 트래픽보다 우선 처리되며 로드 셰딩(503 server overloaded)을 당할 가능성이 더 낮습니다.
  • Fast 모드: Fast 변형은 초당 100개 이상의 생성 토큰 처리량을 목표로 하며, 문서에 따르면 Fast 변형은 다른 모델이 아니고 모델 품질도 그대로 유지됩니다.
  • 모델 카탈로그: 문서에는 텍스트, 비전, 오디오, 이미지, 임베딩 전반에 걸쳐 100개 이상의 지원 모델이 나열되어 있습니다.
  • 배치 작업: Batch API는 대량의 요청을 비동기로 처리합니다. 각 작업은 12, 24, 48 또는 72시간 중 선택한 제한 시간에 맞춰 실행되며, 작업이 만료되면 완료된 요청은 저장됩니다.

전용 배포

  • 온디맨드 배포: 멀티 리전을 지원하고 사후 학습된 모델도 지원하는 전용 배포입니다.
  • 커스텀 가중치: Hugging Face 또는 다른 곳에서 자체 모델(지원되는 아키텍처에 한함)을 업로드할 수 있습니다.
  • 예약 용량: 엔터프라이즈 계정은 보장된 용량, 더 높은 할당량, 더 낮은 GPU 시간당 가격을 위해 예약 용량을 구매할 수 있으며, 보통 1년 약정이 따릅니다.
  • 하나의 배포에 여러 어댑터: Multi-LoRA 배포는 하나의 베이스 모델 배포에 최대 100개의 LoRA 모델을 애드온으로 로드합니다.

학습 및 파인튜닝

  • 세 가지 진입 경로: 가이드형 경로(작업을 설명하고, 계획과 비용을 검토한 뒤, 실행을 승인), Fireworks가 스케줄링과 프로덕션 이관을 맡는 구성 중심 경로, 그리고 Fireworks GPU에서 손실 함수, 트레이너, RL 루프를 직접 작성하는 코드 경로가 있습니다.
  • 규모: 지도 파인튜닝과 강화 파인튜닝은 최대 1T+ 파라미터 모델까지 제공됩니다.
  • Serverless Training API: 출시 모델에서 LoRA 학습을 하기 위한 공유형 상시 가동 트레이너 풀로, 프로비저닝이 필요 없고 유휴 비용도 없습니다.

이러한 옵션 덕분에 오픈 모델 파인튜닝은 별도 제품이 아니라 서빙으로 이어지는 파이프라인이 됩니다. 홈페이지에 따르면 모든 체크포인트는 몇 초 만에 프로덕션에 배포됩니다.

Nexus와 FireRouter

  • Nexus: 오픈 모델과 모델 라우터를 코딩 하네스, 에이전트, LLM 게이트웨이에 연결하며, 지원되는 서버리스 모델에 대해 사용량 가시성과 사용자별 지출 한도를 제공합니다.
  • FireRouter: 하나의 모델 ID만 노출하고 새로운 사용자 턴마다 모델을 고르므로, 쉬운 턴은 Fireworks 오픈 모델로, 어려운 턴은 Claude Opus 같은 클로즈드 모델로 보낼 수 있습니다.
  • 지출 절감 주장: Fireworks는 Nexus를 클로즈드 모델 API의 드롭인 대체재로 홍보하며 AI 코딩 지출을 50~75% 줄일 수 있다고 하는데, 이는 벤더가 제시한 수치입니다.

가이드

일반적인 첫 프로젝트는 서버리스 테스트에서 비용 관리로 넘어갑니다.

  1. 유효한 결제 수단과 청구지 주소를 추가한 뒤 크레딧을 구매합니다. 서버리스, 온디맨드 배포, 학습 사용량은 모두 이 잔액에서 차감됩니다.
  2. OpenAI Python 클라이언트 라이브러리에서 base URL과 API 키를 바꾸면 Fireworks와 연동할 수 있습니다.
  3. 피크 시간대에도 버텨야 하는 트래픽은 요청의 서비스 티어를 Priority로 설정하고, 지연 시간에 민감한 기능은 Fast 변형이 있는 경우 모델 ID를 Fast 변형으로 바꿉니다.
  4. 월 지출 한도를 설정합니다. 기본적으로 사용량이 월 지출 한도의 80%에 도달하면 Fireworks가 경고 이메일을 보내며, 결제 페이지에서 알림 임계값을 더 추가할 수 있습니다.
  5. 출시를 계획하기 전에 firectl quota list를 실행해 계정의 현재 속도 제한, GPU 할당량, 지출 한도, 사용량을 확인합니다.
  6. 학습된 LoRA 모델, 커스텀 모델 또는 고정 버전이 필요하면 서버리스에 의존하지 말고 온디맨드 배포를 생성합니다.

Fireworks 활용 사례와 고객 예시

Fireworks 홈페이지의 고객 인용문은 독립적인 사례 연구가 아니라 벤더가 고른 추천사이지만, 플랫폼이 겨냥하는 워크로드를 보여 줍니다.

  • AI 코딩 제품: Cursor의 최고제품책임자는 고처리량 RL 워크로드와 Composer의 프로덕션 추론을 포함해 Cursor를 뒷받침하는 모델을 대규모로 학습하고 서빙하는 데 Fireworks가 핵심 파트너였다고 말합니다.
  • 더 빠른 소비자 앱: 한 Quora 제품 책임자는 모델 하나를 마이그레이션한 뒤 응답 시간이 3배 빨라졌다고 밝혔고, 회사는 이것이 참여 지표를 끌어올렸다고 말합니다.
  • 파인튜닝된 복합 모델: Vercel의 CTO는 자사 v0 모델이 Fireworks와 함께 파인튜닝한 강화 학습 모델을 사용하며 SOTA보다 상당히 뛰어난 성능을 낸다고 말합니다.
  • Azure를 통한 엔터프라이즈 에이전트: UiPath는 Azure Foundry에서 Fireworks를 실행해 오픈 모델로 Autopilot과 Delegate를 구동합니다.
  • 클로즈드 모델을 오픈 모델로 교체: Gumloop은 사내 전사용 에이전트를 Opus 4.8에서 GLM-5.2로 옮겼고, 경험의 차이를 알아챈 사람이 아무도 없었다고 전합니다.

누구를 위한 것인가

  • 프로토타이핑 팀: 인기 모델을 토큰당 과금으로 서버리스에서 사용하는 방식은 감으로 품질을 확인하는 바이브 테스트와 프로토타이핑에 이상적이라고 소개됩니다.
  • 자체 모델이나 학습된 모델을 운영하는 팀: 온디맨드는 커스텀 베이스 모델, 학습된 LoRA 모델, 그리고 하드웨어와 레플리카를 제어해야 하는 맞춤 지연 시간 요건의 워크로드에 적합합니다.
  • 규제 대상 기업: 계정 전체에 적용되는 데이터 무보존 정책과 리전 고정 추론은 셀프서브 설정이 아니라 엔터프라이즈 기능입니다.

두 가지 경우에는 덜 적합합니다. 고정된 모델 버전이 필요한 팀은 서버리스에서 얻는 이점이 적습니다. 서버리스 모델은 Fireworks 팀이 관리하며 새 모델이 출시되면 업데이트되거나 지원 중단될 수 있기 때문입니다. 약관상 미성년자의 사용은 부모나 법정 후견인이 감독하지 않는 한 금지됩니다.

플랫폼

  • API: OpenAI 및 Anthropic 호환 엔드포인트를 제공하므로 기존 SDK 코드가 Fireworks를 가리키도록 바꿀 수 있습니다.
  • CLI: firectl은 터미널에서 리소스를 생성, 배포, 관리하며 Homebrew로 설치할 수 있습니다.
  • Microsoft Foundry: Fireworks AI는 Microsoft Foundry 내의 퍼스트파티 추론 제공업체이며, 사용량은 Azure를 통해 청구되고 Azure 소비 약정에 반영됩니다.
  • Foundry PayGo 범위: Foundry의 PayGo는 US Data Zone으로 제한되며, PayGo 배포의 처리량 한도는 분당 500,000토큰입니다.
  • 리전: 전용 배포는 GLOBAL, US, CANADA, EUROPE, APAC 멀티 리전을 대상으로 할 수 있습니다.
  • 미국 전용 서버리스: 별도의 미국 엔드포인트가 소수의 모델에 한해 미국 내에서만 추론을 제공하며, EU 전용 서버리스는 영업팀에 문의해야 합니다.

가격

결제는 선불입니다. 자동 충전 기능으로 잔액을 자동으로 채울 수 있고 월 지출 한도로 사용량에 상한을 둘 수 있습니다. 계약 고객은 후불 결제로 전환하는 옵션을 받을 수도 있습니다.

서버리스 추론 가격

가격은 100만 토큰당 USD 기준이며 입력 / 캐시된 입력 / 출력 순으로 표시되고, 2026년 10월 5일에 수집되었습니다.

모델StandardPriority
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

개별 표시되지 않은 텍스트 및 비전 모델은 크기별로 가격이 매겨집니다. 파라미터 4B 미만은 $0.10, 4B~16B는 $0.20, 16B 초과는 $0.90(모두 1M 토큰당)이며 별도의 캐시 요금은 없습니다. 배치 추론은 입력과 출력 모두 서버리스 가격의 50%로 청구됩니다. 2026년 9월 1일부터 출시된 미국 전용 모델은 베이스 모델 서버리스 가격의 1.5배로 책정됩니다.

온디맨드 GPU 가격

온디맨드 배포는 GPU 초 단위로 청구되며 시작 시간에 대한 추가 요금은 없습니다.

GPU분당시간당
H100 80 GB$0.134$8.00
H200 141 GB$0.134$8.00
B200 180 GB$0.217$13.00
B300 288 GB$0.250$15.00
GB300 288 GB$0.334$20.00

리전 제한 배포에는 1.5배 프리미엄 가격이 적용되며 영업팀을 통해 진행됩니다.

파인튜닝 가격

관리형 지도 파인튜닝과 선호도 파인튜닝은 학습 토큰 1M당 가격이 매겨집니다.

베이스 모델 크기LoRA SFTLoRA DPO전체 파라미터 SFT전체 파라미터 DPO
16B 이하$0.50$1.00$1.00$2.00
16.1B~80B$3.00$6.00$6.00$12.00
80B~300B$6.00$12.00$12.00$24.00
300B 초과$10.00$20.00$20.00$40.00

학습 토큰은 학습 데이터셋의 토큰 수에 에폭 수를 곱해 추정합니다. Dedicated Training API 작업은 온디맨드 요금 기준으로 GPU 시간당 가격이 매겨집니다.

서빙 비용은 페이지마다 다르게 읽힙니다. 가격 페이지는 파인튜닝된 모델을 베이스 모델과 같은 가격으로 서빙할 수 있다고 하는 반면, 결제 FAQ는 학습된 LoRA 모델을 서빙하려면 전용 배포가 필요하며 GPU 초 단위로 청구된다고 설명합니다.

크레딧, 티어, 환불

  • 시작 크레딧: 결제 FAQ는 $1 크레딧을 언급합니다. 이를 다 쓰면 결제 수단이 없는 계정은 결제 수단을 추가할 때까지 정지됩니다.
  • 지출 티어: 크레딧을 $50 추가하거나 사용하면 Tier 2, $500이면 Tier 3, $5,000이면 Tier 4로 올라가며, 상위 티어일수록 서버리스 속도 제한 상한이 높아집니다.
  • 대량 구매 가격: Fireworks는 대량 구매나 선불 구매에 할인을 제공합니다.
  • 환불: 서비스 약관은 약관에 명시된 경우를 제외하고 지불한 요금은 환불되지 않는다고 규정합니다.

Fireworks 대안

  • Together AI: 가격 체계가 서버리스 추론, 프로비저닝된 처리량, 단일 테넌트 GPU의 전용 추론, LoRA 또는 전체 파인튜닝을 포괄하며, Fireworks가 판매하는 제품 구분과 같습니다.
  • Baseten: Model APIs와 전용 배포를 결합하며, 전용 배포에서는 사용한 컴퓨팅에 대해서만 분 단위까지 비용을 지불합니다. Basic 플랜은 월 $0의 종량제입니다.

Fireworks는 전용 GPU를 초 단위로 청구하는 반면 Baseten은 분 단위로 계량하며, 이 차이는 짧고 순간적으로 몰리는 배포에서 가장 크게 드러납니다.

제한 사항

속도 제한과 용량

  • 신규 계정 속도 제한: 결제 수단이나 크레딧이 없는 계정은 분당 10개 요청으로 제한되며, 결제 수단과 크레딧이 있어도 계정 전체 상한은 분당 6,000개 요청입니다.
  • 적응형 서버리스 한도: 한도는 사용량에 따라 늘었다 줄었다 하며, 트래픽이 너무 빠르게 증가하면 429를 받게 됩니다.
  • 성공 보장 없음: 서버리스에서는 429 Too Many Requests 또는 503 Service Overloaded 응답을 받을 수 있으며, 한도 이내로 유지해도 로드 셰딩을 막지는 못합니다.
  • 모델 크기별 상한: 생성 토큰 상한은 600B 파라미터 미만 모델의 분당 1.08M 토큰부터 1.6T 파라미터 이상 모델의 216k까지 다양합니다.
  • GPU 할당량: GLOBAL 멀티 리전의 기본 온디맨드 할당량은 H100, H200, B200, B300 각각 GPU 16개이며, GB300과 A100은 0에서 시작합니다.
  • 학습 할당량에는 카드 필요: 결제 수단이 없으면 학습 GPU 할당량은 0이고, 결제 수단이 등록되어 있으면 유형별로 GPU 32개입니다.

운영상 경계

  • 모델 제거: Fireworks는 서버리스 모델을 제거하기 최소 2주 전에 사전 공지하며, 인기 모델은 공지 기간이 더 깁니다.
  • 유휴 배포: 기본적으로 배포는 1시간 동안 사용되지 않으면 0으로 축소되며, 최소 레플리카가 0으로 설정된 배포는 7일간 트래픽이 없으면 삭제됩니다.
  • 선점형 용량: 선점형 배포는 유휴 GPU를 빌려 쓰며 요청 도중 경고 없이 선점될 수 있으므로 평가와 배치 작업 용도로만 쓰도록 되어 있습니다.
  • 지출 하드 스톱: 사용량이 월 지출 한도의 100%에 도달하면 서버리스 추론, 배포, 학습 전반의 모든 API 요청이 일시 중지됩니다(엔터프라이즈 계정은 알림만 받습니다).
  • 지출 보고 지연: 총지출 수치는 실시간 트래픽보다 하루 이상 늦게 반영될 수 있으며, 새로 출시된 모델에서 특히 그렇습니다.
  • PCI 미준수: 약관에 따르면 Fireworks는 PCI를 준수하지 않으며 PCI 준수를 갖출 의무도 없습니다.

데이터 보존과 학습 사용

기본적으로 Fireworks는 사용자의 명시적 옵트인 없이 어떤 오픈 모델에 대해서도 프롬프트나 생성 데이터를 기록하거나 저장하지 않습니다. 다만 토큰 수와 같은 요청 메타데이터는 기록합니다. 프롬프트 캐싱이 활성화되면 일부 프롬프트 데이터가 휘발성 메모리에 몇 분간 남을 수 있습니다.

Response API는 예외입니다. 기본적으로 대화를 저장하며, 저장된 대화 데이터는 30일 후 자동 삭제됩니다. 약관은 또한 데이터 무보존 약속을 추론으로 한정하며, 학습, 파인튜닝, 에이전트 기능처럼 설계상 데이터를 보관하는 기능에는 적용되지 않습니다.

학습 사용에 대해서는 두 문서의 표현이 다릅니다. 서비스 약관은 Fireworks가 고객의 콘텐츠를 자사 모델 학습이나 서비스 개선에 사용하지 않는다고 말합니다. 개인정보 처리방침은 고객의 명시적 옵트인 없이는 프롬프트, 학습 데이터, API 입력을 모델 학습이나 개선에 사용하지 않는다고 말합니다. 당사자 간에는 고객이 콘텐츠에 대한 모든 권리, 소유권, 이익을 가지며, 약관은 콘텐츠를 고객의 입력과 출력으로 정의합니다.

엔터프라이즈 관리자는 계정 전체 데이터 무보존 정책을 켤 수 있습니다. 이 정책은 배치 추론 작업, 파인튜닝 및 RL 작업, 데이터셋 업로드, FireRouter 가상 모델을 포함해 고객 콘텐츠를 영구 저장하게 되는 모든 작업을 거부합니다. FireRouter가 턴을 Claude나 GPT로 보낼 때 해당 클로즈드 모델은 고객 자신의 Anthropic 또는 OpenAI 계정에서 실행됩니다.

보안 및 컴플라이언스 관련 진술

다음은 독립 감사가 아닌 벤더의 진술입니다.

  • Fireworks는 ISO 27001, ISO 27701, ISO 42001 인증을 취득했으며 SOC 2 Type II를 보유하고 있다고 밝힙니다.
  • Fireworks는 스스로 HIPAA를 준수한다고 설명합니다.
  • 데이터는 전송 중에는 TLS 1.2+로, 저장 시에는 AES-256으로 암호화됩니다.
  • 추론을 한 리전으로 제한하는 데이터 레지던시는 엔터프라이즈 기능이며, 나열된 옵션은 US입니다.

FAQ

Q1. 무료 티어가 있나요?

확인한 가격 페이지에는 무료 플랜이 보이지 않습니다. 결제 FAQ에 언급된 $1 크레딧 외에 계속 사용하려면 결제 수단과 선불 크레딧이 필요합니다.

Q2. 파인튜닝한 LoRA 모델을 서버리스에서 서빙할 수 있나요?

아니요. LoRA 모델에는 GPU 시간으로 청구되는 온디맨드 배포가 필요하며, 하나의 배포에 최대 100개의 LoRA 어댑터를 호스팅해 그 비용을 분산할 수 있습니다.

Q3. 전용 GPU가 서버리스보다 저렴한 경우는 언제인가요?

서버리스 추론 가격은 토큰마다 청구되므로 유휴 시간에는 비용이 들지 않습니다. 온디맨드 배포는 높은 활용률에서 더 저렴하다고 설명되며, 토큰 단위가 아니라 GPU 초 단위로 청구됩니다.

비슷한 도구를 아시나요?
다른 훌륭한 AI 도구를 알고 계시다면 저희에게 제출해 주세요