Modal은 GPU와 CPU에서 Python 코드를 실행하고 초 단위로 과금하는 서버리스 클라우드이며, 회사는 이를 AI 애플리케이션을 대규모로 개발·학습·서빙하는 팀용 클라우드 인프라라고 설명합니다.
Modal은 코드를 컨테이너에 넣어 클라우드에서 실행하고, 트래픽이 늘면 컨테이너를 자동 추가하며, 주요 클라우드 전반의 용량을 모아 각 작업의 실행 위치를 고릅니다. 컨테이너 이미지와 GPU 요청을 Python 코드로 작성하므로 Modal 앱에는 YAML 배포 파일이 없습니다.
Modal Labs가 modal.com을 운영합니다. 독립 기술 매체 보도에 따르면 Modal은 2021년 CEO Erik Bernhardsson과 CTO Akshat Bubna가 설립했으며, 회사는 General Catalyst와 Redpoint Ventures 등 투자사로부터 4억 6,600만 달러 이상을 유치했다고 밝힙니다. 2026년 9월 28일, 익명 소식통을 인용한 한 기술 뉴스 보도는 Modal Labs(보도는 AI 추론 인프라 제공업체로 지칭)가 Accel이 주도하는 7억 5,000만 달러 투자 라운드를 기업가치 157억 5,000만 달러로 성사 직전에 두고 있다고 전했으며, Modal Labs는 논평을 거부했습니다.
Modal은 추론(회사 표현으로는 1초 미만의 콜드 스타트), 병렬 배치 작업, 학습과 파인튜닝, AI 생성 코드용 격리 샌드박스, GPU 기반 협업 Notebooks를 다룹니다.
gpu 인수는 T4, L4, A10, L40S, A100(일반, 40 GB 또는 80 GB), RTX PRO 6000, H100(또는 H100!), H200, B200(또는 B200+), B300을 받습니다. B300, B200, H200, H100, A100, L4, T4, L40S는 컨테이너당 최대 8개 GPU(GPU RAM 최대 2,304 GB)를 쓸 수 있고, A10은 GPU 4개와 96 GB가 한도입니다.
벤치마크에 영향을 주는 자동 업그레이드가 두 가지 있습니다. H100 요청은 H200에서, A100 요청은 80 GB A100에서 원래 가격으로 실행될 수 있으며, H100!을 요청하면 H200 업그레이드에서 제외됩니다. 함수에 GPU 유형을 선호 순으로 나열할 수도 있으며, Modal은 목록 순서대로 대체합니다.
Modal Sandboxes는 런타임에 정의되는 보안 컨테이너로, 신뢰할 수 없는 사용자나 에이전트 코드를 실행합니다. Modal은 1분 안에 프로그래밍 방식으로 수백만 개를 만들 수 있고 빠른 시작을 위한 스냅샷과 복원을 지원한다고 말합니다.
서버리스 요금, 유휴 시 자동 종료, Modal GPU, 실시간 공동 편집을 갖춘 호스팅형 Jupyter 노트북입니다.
Modal은 2026년 10월 1일 Modal Clusters가 @modal.clustered 데코레이터를 통해 정식 출시되었다고 발표했습니다. RDMA를 갖춘 멀티노드 GPU 그룹으로, 공유 용량 풀에서 갱 스케줄링되며 초 단위로 과금됩니다.
pip install modal을 실행한 뒤 modal setup으로 인증합니다(첫 번째 형식이 실패하면 python -m modal setup).@app.function(...) 데코레이터를 붙인 Python 함수를 작성해 컨테이너 이미지와 GPU를 지정하고, modal run path/to/file.py로 파일을 실행합니다.Modal은 컨테이너가 약 1초 만에 부팅된다고 말하지만, 임포트 등 전역 범위 설정이 실행된 뒤에야 웜 상태가 되므로 준비까지 몇 초에서 몇 분이 걸릴 수 있습니다. 다음 세 가지 설정으로 지연 시간과 유휴 비용을 맞바꿉니다.
scaledown_window: 유휴 컨테이너를 2초에서 20분까지 살려 둡니다. 창이 길수록 콜드 스타트는 줄지만 유휴 리소스가 과금됩니다.min_containers와 buffer_containers: 전자는 웜 컨테이너 하한을 유지해 함수가 0으로 줄지 않게 하고, 후자는 함수가 활성 상태일 때 여분의 컨테이너를 추가합니다.us 같은 광역 리전은 협역 리전보다 리소스 풀이 커서 콜드 스타트 시간과 가용성이 개선됩니다.Modal은 컨테이너화할 수 있는 모든 Python 애플리케이션을 배포할 수 있으며, 수평 확장되는 연산 집약적 작업, 즉 대규모 ML 추론, 모델 학습과 파인튜닝, 데이터 파이프라인, 과학 계산, 작업 큐를 겨냥합니다.
위 세 고객 발언은 홈페이지 추천사이며 독립 사례 연구가 아닙니다.
이번 조사에서 찾은 독립 리뷰 신호는 제한적입니다. 한 런칭 커뮤니티 리뷰 플랫폼에서 2026년 10월 5일 수집 기준 Modal은 리뷰 61건으로 5.0점을 받았고, 해당 플랫폼의 AI 요약은 리뷰어가 대부분 창업자이며 리뷰에 비판적 피드백이 거의 없다고 말합니다.
routing_region은 us-west(오리건), eu-west(더블린), ap-south(뭄바이)도 받습니다.Modal은 월간 플랜에 초 단위 GPU 요금과 사용량 기반 CPU·메모리 요금을 결합합니다. 아래 정가는 2026년 10월 5일에 수집했습니다.
| 플랜 | 플랫폼 요금 | 포함 컴퓨팅 | 좌석 | 컨테이너 / GPU 동시 실행 | 로그 보존 | 포함 송신 트래픽 |
|---|---|---|---|---|---|---|
| Starter | 월 $0 + 컴퓨팅 | 월 $30 | 3 | 100 / 10 | 1일 | 월 1 TiB |
| Team | 월 $250 + 컴퓨팅 | 월 $100 | 무제한 | 5000 / 50 | 30일 | 월 10 TiB |
| Enterprise | 맞춤 | 맞춤 | 무제한 | 더 높은 GPU 동시 실행 | 맞춤 | 월 100 TiB |
Enterprise에는 사용량 기반 할인, 임베디드 ML 엔지니어링 서비스, 비공개 Slack 지원, 감사 로그, Okta SSO, HIPAA가 추가됩니다. Starter는 배포된 앱 200개와 배포된 크론 작업 5개를 허용하며 커스텀 도메인, 배포 롤백, 환경 수준 예산, 고정 IP 프록시, RBAC는 제외되고, Team은 롤백 버전 3개를 보관합니다.
| 리소스 | 초당 가격 |
|---|---|
| Nvidia B300 | $0.001972 |
| Nvidia B200 | $0.001736 |
| Nvidia H200 SXM | $0.001261 |
| Nvidia H100 SXM5 | $0.001097 |
| Nvidia RTX PRO 6000 | $0.000842 |
| Nvidia A100, 80 GB | $0.000694 |
| Nvidia A100, 40 GB | $0.000583 |
| Nvidia L40S | $0.000542 |
| Nvidia A10 | $0.000306 |
| Nvidia L4 | $0.000222 |
| Nvidia T4 | $0.000164 |
| CPU, 물리 코어당(2 vCPU) | $0.0000131 |
| 메모리, GiB당 | $0.00000222 |
CPU는 컨테이너당 최소 0.125코어입니다. 샌드박스와 Notebooks는 더 높은 CPU·메모리 요금인 초당 코어당 $0.00003942와 GiB당 $0.00000667를 적용하며 GPU는 표준 가격입니다. Volumes는 1 TiB 무료 이후 월 GiB당 $0.09이고, 플랜 허용량을 넘는 송신 트래픽은 GiB당 $0.04입니다. Modal의 계산 예시에서 A10G의 Stable Diffusion은 이미지 1,000장당 약 $0.491입니다.
nonpreemptible=True는 CPU와 메모리 정가를 3배로 만들며 GPU 함수에는 사용할 수 없습니다.아래 서버리스 GPU 플랫폼들은 주로 유휴 시간 과금 방식과 GPU 선택 폭에서 Modal과 다릅니다.
| 옵션 | GPU 선택 | 0으로 축소 | 유휴 및 과금 규칙 |
|---|---|---|---|
| Google Cloud Run(GPU) | RTX PRO 6000 Blackwell(96 GB) 또는 L4(24 GB) | 예 | 인스턴스 기반 과금, 최소 인스턴스는 유휴 상태여도 전액 과금 |
| RunPod Serverless | 이번 비교에서 다루지 않음 | 플렉스 워커는 예, 액티브 워커는 24시간 상시 실행 | 워커 시작부터 완전히 멈출 때까지 초 단위 과금, 올림 처리 |
| Replicate | 이번 비교에서 다루지 않음 | 공개 모델은 예 | 대부분의 비공개 모델은 전용 하드웨어에서 실행되며 설정, 유휴, 활성 시간이 과금됨 |
RunPod의 플렉스와 액티브 구분은 Modal의 min_containers 선택과 닮았습니다. Replicate는 대부분의 공개 모델을 실행 시간으로, 일부는 입력과 출력 기준으로 과금합니다. Modal의 차별점은 Python으로 정의하는 인프라와 같은 계정 안의 샌드박스, 그리고 Cloud Run보다 긴 GPU 목록입니다.
routing_region은 함수를 처음 배포할 때만 설정할 수 있으며, 2 MiB보다 큰 입력과 출력은 여전히 us-east의 객체 스토리지로 갑니다.Modal의 계약은 암호화폐 채굴 또는 관련 블록체인 활동, 서비스 거부 공격, P2P 파일 공유, 범용 파일 호스팅 또는 미디어 서빙 플랫폼을 금지합니다.
Starter는 플랫폼 요금이 없고 매월 $30의 컴퓨팅이 포함되지만, 청구 가이드는 결제 수단 등록을 요구하며 공유 엔드포인트 토큰은 첫 요청부터 과금됩니다.
0으로 축소된 뒤에는 부과되지 않습니다. 기본 60초 킵얼라이브와 더 긴 scaledown_window 안의 유휴 시간은 과금되며, min_containers를 쓰면 함수가 결코 0에 도달하지 않습니다.
함수와 샌드박스는 1.15배 또는 1.75배 배수로 EU 리전에 고정하고 eu-west를 통해 라우팅할 수 있지만, 애플리케이션 로그는 미국에 남고, 큰 입력과 출력은 us-east를 거치며, 공유 엔드포인트는 고정할 수 없습니다.