Replicate 让你用云 API 运行 AI 模型,不必理解机器学习,也不必自己管理基础设施。一次 HTTP 请求把输入交给图像、视频、音频或语言模型,再把结果取回来——不用租 GPU,也不用自己构建容器。它做的事就是把 AI 模型 API 化。
这个接口背后是三件事:运行别人已经发布的模型、用自己的数据微调出新模型、把自己打包好的代码部署上去,每一件都只需要一行代码。
运营主体是 Replicate, LLC.,地址在旧金山 101 Townsend Street。2025 年 11 月 17 日归属发生变化:这家「运行 AI 模型的头部平台」宣布加入 Cloudflare。产品面被明确排除在这次变动之外——厂商说 API 不变、现在用的模型会继续可用,收购方也给了同样的承诺:现有用户的 API 与工作流不会中断。发版并未停下,更新日志最新一条新增了一组 Markdown 指令文件,让编码助手掌握在该平台上使用 AI 模型的专门知识。
目录规模只有厂商口径:收购公告称覆盖超过 50,000 个开源模型与微调模型,本轮核对的渠道里没有出现独立的计数。
一套 API 背后是四类对象,它们在延迟与成本上表现并不相同:
正因为这种分层,「平台上的一个模型」并不是单一的性能画像:官方模型常驻预热、随时响应请求,调用时不必担心冷启动;而一个少人使用的社区模型会先从零加载。
容量无需配置就能双向伸缩:流量激增时自动扩容,闲置时缩回到零。默认策略太松时,部署(deployment)这项功能可以控制任意模型的硬件与扩缩容参数。面向团队则有组织(organization),用来共享模型、API token、账单与仪表盘等访问权限。
默认的安全过滤器范围比字面窄:平台只对 SDXL 基础模型、Flux 基础模型以及两者的全部衍生微调在网页端启用安全检查器。它另有一个出口——通过 API 调用模型时可以关闭安全检查器——代价是 API 路径上没有保证生效的过滤。
第一次接入很短,但其中两步现在便宜、以后昂贵。
有据可查的能力对应的是一组范围不宽的任务。
同样这些事实也划出了边界:需要有保证的响应时间、单次运行超过三十分钟,或者要求产出留在平台上以后再取,都超出了标准账户的可查范围。
它适合这样的研发团队:想要无服务器 GPU 推理,又不想自己拥有一整套机器学习技术栈,并且能接受浮动账单而不是自己运维集群。它同样适合模型作者,因为发布与微调在这里是一等操作。
有四种情形并不合适,每一条都能追到公开条款上:
一切都经 HTTP 触达。官方客户端覆盖 Node.js、Python、Swift 与 Go,另有一个托管的 MCP 客户端;Elixir 等其他生态由社区贡献者维护而非厂商维护,这会改变你能期待的支持力度。
模型也可以直接在站点上运行,这是写代码之前查看某个模型输入项最快的方式。
Replicate 价格没有套餐分档。你只为实际用量付费:一部分模型按硬件与时间计费,另一部分按输入与输出计费。适用哪一套计量由模型本身决定,而不是由你的账户决定。按时间计费时,单价随硬件走:
| 硬件 | 每秒 | 每小时 |
|---|---|---|
| Nvidia T4 | $0.000225 | $0.81 |
| Nvidia L40S | $0.000975 | $3.51 |
| Nvidia A100(80GB) | $0.001400 | $5.04 |
| Nvidia H100 | $0.001525 | $5.49 |
这些是每秒运行时长的单价,不是每次请求的价格:多数模型按运行时长计费,每秒单价随所用硬件变化,因此同一条提示词在更重的模型上更贵。按输出计费的一侧刚好相反——官方模型按输出图片数、视频输出秒数、输入与输出 token 数这类可预测指标计价,公开样例从每张输出图片 $0.04 到每百万输入 token $3.75。只有在这一侧,单次请求的预算才能提前算出来;而最高档并不开放自助购买:更多多卡 H100 容量需要签订承诺消费合同。
在共享容量上冷启动是延迟问题,在独占容量上则是计费问题。共享这一侧,使用公共模型时只对实际处理请求的活跃时间付费,启动与空闲时间免费。等待本身仍然真实——某些情况下这个过程会花上数分钟——而且不由你控制,因为默认与其他客户共享硬件池,请求会进入与其他客户请求混排的共享队列。
把等待去掉就等于换了计量口径。在独占容量上,实例在线的全部时间都要付费:启动的时间、等待请求的空闲时间,以及处理请求的活跃时间。快速启动微调是例外,无论公开还是私有都只按活跃处理时间计费。
免费入口存在,但既有边界又没有定义。部分模型可以免费运行,过一段时间后会被要求设置账单——没有给出额度、模型清单或时长。未充值的账户还会被限流:获赠额度但未在档案中绑定支付方式时,速率被限到每秒 1 次请求、每分钟最多 6 次请求。
付费一侧是预付制且会过期。已购额度自购买日起 1 年内有效,除法律另有要求外不可退款,条款也重述了到期规则:每笔用于充值预付余额的付款若未用尽,将在付款日起第 12 个月末到期。自动充值有下限——最低触发阈值 $5、最低充值余额 $15——余额一旦归零,新任务会被阻止启动,正在运行的基础设施会被关停。
企业条款是谈出来的,不是公开的:专属客户经理、优先支持、更高的 GPU 上限与性能 SLA,批量折扣与承诺消费挂钩。
两个事实承担了对比中的大部分工作。第一是广度:企业用户通过一份 API 与一份合同获得 50,000+ 个模型的访问权,这与专攻单一模态的服务不是同一种命题。第二是最便宜的配置就是共享配置,而在那里有时会遇到冷启动或扩容限制,具体取决于其他客户如何使用该模型。
独立来源给出的是赛道名单而不是排名。该公司 2023 年 2 月亮相时的署名科技报道描述了一个拥挤的市场:这家初创公司与 Hugging Face、OctoML 以及某种意义上的 Runway ML 等厂商竞争,后者合计融资数亿美元。一场公开的开发者讨论后来给出了一份更长的从业者名单——这个赛道里到底有多少玩家?Replicate、RunPod、Modal、Northflank、FAL。
区分它们靠三个问题:这家服务商公开的是每秒硬件单价还是只有按输出的价格;固定实例之后是否对空闲时间计费;以及它会保留你的产出,还是像这家一样按定时器删除。本轮没有任何独立基准测试达到来源门槛——检索出来的对比页面要么由竞争平台自己发布,要么来自带推荐链路的聚合站。
文档和合同对「失败的运行」说法不同。计费文档称任何模型的运行失败都不收费,而取消官方模型的运行仍可能被计费。条款则称部分运行与失败尝试按系统记录的失败发生节点计费。第三条规则针对级联调用:模型失败时仍按本次运行时长,加上失败前已调用的下游模型成本计费。这些页面彼此不一致,而同一批日志正是结算计费争议时采用的记录,因此失败率高的工作负载需要把适用规则落成书面。
自助档位上没有任何东西被合同锁定。厂商保留随时自行变更服务的权利,包括限制或停止服务的某些功能、临时或永久生效,且无需事先通知。加上没有模型可用性承诺,你依赖的某个模型因此可能在没有通知的情况下消失——所以要锁定版本并保留退路。争议解决同样被约束:条款适用美国加利福尼亚州法律,并且不允许集体仲裁程序。
统一的接口掩盖了并不统一的许可证:你不得违反模型所有者的开源许可证限制去使用机器学习模型。宽松许可、仅限研究与专有条款,都在同一个调用背后。
保留期是不对称的。经 API 创建的预测在一小时的定时器上被清除,而经网页界面创建的预测数据无限期保留,因此累积记录的是浏览器这条路径。监控写得很直白:厂商保留监控你使用服务情况的权利,以确保符合政策,其中包含对内容与行为的自动与人工审查。隐私政策另外提示,上传的训练数据可能包含各类信息,其中部分在多部隐私法下可能被视为「敏感」。
产出权利很宽但有条件。厂商把输出的全部权利、所有权与利益(如有)授予你,包括出售或发表等商业用途,但以适用的第三方条款为条件——这个条件就是生成它的那个模型所附带的许可。作为交换,你为自己的输入授予一份许可,范围限于提供输出、训练并生成客户衍生模型、按条款提供服务,以及创建并汇编 Resultant Data。至于这些输入会不会被用于训练厂商自有的模型,已公开的政策两边都没有说明,这里也不替它补。
平台声明其不按美国各州隐私法的定义出售或共享个人信息,政策同时表示不主动收集 16 岁以下儿童的个人信息。
有的是一份有边界的免费额度,不是免费套餐:部分模型可以免费运行,直到被要求设置账单,而额度、时长与模型清单都没有公布。在档案中绑定支付方式之前,吞吐被限到每秒 1 次请求。
公共模型上不会,那里启动与空闲时间免费——但固定容量之后情况就变了,独占实例与部署同样对启动与空闲时间计费。
会。额度自购买之日起一年内有效,合同写明每笔付款若未用尽,将在付款后第 12 个月末到期。全部预付余额均不可退款,法律另有要求或本协议另有明确规定的除外。
经 API 调用时默认不会:输入、输出、文件与日志会在一小时后删除,需要留的东西必须自己复制出去。浏览器里创建的预测则会一直保留,直到你手动删除。