Modal 是一个无服务器云平台,在 GPU 和 CPU 上运行 Python 代码并按秒计费;公司将其描述为面向大规模开发、训练和部署 AI 应用的团队的云基础设施。
Modal 把你的代码放进容器、在云端执行,并在流量增长时自动增加容器;它汇集多家主流云的容量,为每个任务选择运行位置。容器镜像和 GPU 需求都用 Python 代码编写,因此 Modal 应用没有 YAML 部署文件。
Modal Labs 运营 modal.com。独立科技媒体报道称,Modal 于 2021 年由 CEO Erik Bernhardsson 和 CTO Akshat Bubna 创立;公司自称已从 General Catalyst、Redpoint Ventures 等投资方融资超过 4.66 亿美元。2026 年 9 月 28 日,一篇援引匿名消息人士的科技新闻报道称,Modal Labs(该报道称其为 AI 推理基础设施提供商)正接近达成一轮由 Accel 领投的 7.5 亿美元融资,估值 157.5 亿美元;Modal Labs 拒绝置评。
Modal 覆盖推理(其所称的亚秒级冷启动)、并行批处理任务、训练与微调、用于运行 AI 生成代码的隔离沙箱,以及配备 GPU 的协作 Notebooks。
gpu 参数接受 T4、L4、A10、L40S、A100(通用、40 GB 或 80 GB)、RTX PRO 6000、H100(或 H100!)、H200、B200(或 B200+)和 B300。B300、B200、H200、H100、A100、L4、T4 和 L40S 每个容器最多 8 块 GPU(GPU 内存最多 2,304 GB);A10 最多 4 块 GPU、96 GB。
有两项自动升级会影响基准测试:H100 请求可能在 H200 上运行,A100 请求可能在 80 GB A100 上运行,均按原价计费;请求 H100! 则不参与 H200 升级。函数也可按优先顺序列出多种 GPU 类型,Modal 会沿列表依次回退。
Modal Sandboxes 是在运行时定义的安全容器,用于执行不受信任的用户代码或智能体代码。Modal 称可在一分钟内以编程方式创建数百万个,并支持快照与恢复以加快启动。
托管的 Jupyter 笔记本,采用无服务器计价,空闲时自动关闭,可使用 Modal GPU,并支持实时协作编辑。
Modal 于 2026 年 10 月 1 日宣布,Modal Clusters 已通过 @modal.clustered 装饰器正式可用:即带 RDMA 的多节点 GPU 组,从共享容量池成组调度,按秒计费。
pip install modal,再运行 modal setup 完成认证(若前一种形式失败,改用 python -m modal setup)。@app.function(...) 装饰器的 Python 函数,指定容器镜像和 GPU,再用 modal run path/to/file.py 运行该文件。Modal 称容器约一秒即可启动,但只有在导入和其他全局作用域初始化运行完毕后,容器才算预热,因此就绪可能需要数秒到数分钟。以下三项设置在延迟与空闲开销之间取舍:
scaledown_window:让空闲容器保持存活 2 秒到 20 分钟;窗口越长,冷启动越少,但空闲资源要计费。min_containers 与 buffer_containers:前者维持预热容器的下限,使函数永不缩至零;后者在函数活跃时增加备用容器。us 这类宽区域比窄区域的资源池更大,可改善冷启动时间和可用性。Modal 可部署任何可容器化的 Python 应用,面向可横向扩展的计算密集型工作:大规模机器学习推理、模型训练与微调、数据管道、科学计算和任务队列。
以上三条客户陈述是官网首页的推荐语,并非独立案例研究。
本轮找到的独立评测信号有限:在一个面向产品发布社区的评测平台上,Modal 于 2026 年 10 月 5 日抓取时基于 61 条评价得分 5.0;该平台的 AI 摘要称评价者大多是创始人,评价中几乎没有批评性反馈。
routing_region 还接受 us-west(俄勒冈)、eu-west(都柏林)和 ap-south(孟买)。Modal 将月度套餐与按秒计费的 GPU 价格、按量计量的 CPU 和内存结合;下列标价于 2026 年 10 月 5 日获取。
| 套餐 | 平台费 | 含算力额度 | 席位 | 容器 / GPU 并发 | 日志保留 | 含出站流量 |
|---|---|---|---|---|---|---|
| Starter | 每月 $0 + 算力费用 | 每月 $30 | 3 | 100 / 10 | 1 天 | 每月 1 TiB |
| Team | 每月 $250 + 算力费用 | 每月 $100 | 不限 | 5000 / 50 | 30 天 | 每月 10 TiB |
| Enterprise | 定制 | 定制 | 不限 | 更高的 GPU 并发 | 定制 | 每月 100 TiB |
Enterprise 额外提供基于用量的折扣、嵌入式机器学习工程服务、私有 Slack 支持、审计日志、Okta SSO 和 HIPAA。Starter 允许 200 个已部署应用和 5 个已部署的定时任务,不含自定义域名、部署回滚、环境级预算、静态 IP 代理和 RBAC;Team 保留 3 个回滚版本。
| 资源 | 每秒价格 |
|---|---|
| Nvidia B300 | $0.001972 |
| Nvidia B200 | $0.001736 |
| Nvidia H200 SXM | $0.001261 |
| Nvidia H100 SXM5 | $0.001097 |
| Nvidia RTX PRO 6000 | $0.000842 |
| Nvidia A100,80 GB | $0.000694 |
| Nvidia A100,40 GB | $0.000583 |
| Nvidia L40S | $0.000542 |
| Nvidia A10 | $0.000306 |
| Nvidia L4 | $0.000222 |
| Nvidia T4 | $0.000164 |
| CPU,每个物理核心(2 vCPU) | $0.0000131 |
| 内存,每 GiB | $0.00000222 |
CPU 每个容器最少 0.125 核。沙箱和 Notebooks 使用更高的 CPU 与内存费率,每核每秒 $0.00003942、每 GiB 每秒 $0.00000667,GPU 按标准价格计费。Volumes 在 1 TiB 免费额度之后每 GiB 每月 $0.09,超出套餐额度的出站流量每 GiB $0.04。Modal 的计算示例显示,在 A10G 上运行 Stable Diffusion 约为每 1,000 张图片 $0.491。
nonpreemptible=True 会使 CPU 和内存标价变为三倍,且不适用于 GPU 函数。下列各无服务器 GPU 平台与 Modal 的主要区别在于空闲时间如何计费,以及 GPU 选项有多丰富。
| 选项 | GPU 选择 | 缩至零 | 空闲与计费规则 |
|---|---|---|---|
| Google Cloud Run(GPU) | RTX PRO 6000 Blackwell(96 GB)或 L4(24 GB) | 是 | 按实例计费;最小实例即使空闲也按全价计费 |
| RunPod Serverless | 本次比较未涵盖 | 弹性 worker 可以;活跃 worker 全天候运行 | 从 worker 启动到完全停止按秒计费,向上取整 |
| Replicate | 本次比较未涵盖 | 公开模型可以 | 大多数私有模型运行在专用硬件上,按设置、空闲和活跃时间计费 |
RunPod 的弹性与活跃之分类似 Modal 的 min_containers 选择。Replicate 对多数公开模型按运行时间计费,部分按输入和输出计费。Modal 的差异化在于用 Python 定义基础设施、同一账户内即有沙箱,以及比 Cloud Run 更长的 GPU 列表。
routing_region 只能在函数首次部署时设置,且大于 2 MiB 的输入和输出仍会进入 us-east 的对象存储。Modal 的协议禁止加密货币挖矿或相关区块链活动、拒绝服务攻击、点对点文件共享,以及通用文件托管或媒体服务平台。
Starter 没有平台费,每月含 $30 算力额度,但计费指南要求绑定支付方式,且共享端点 token 从第一次请求起计费。
缩至零之后不会。默认 60 秒保活时间以及较长 scaledown_window 内的空闲时间都会计费,而 min_containers 会让函数永远不缩至零。
函数和沙箱可按 1.15 倍或 1.75 倍的倍数固定到欧盟区域,并经 eu-west 路由,但应用日志仍留在美国,大型输入和输出会经过 us-east,且共享端点无法固定区域。