Apify 是一个网页抓取平台,同时覆盖浏览器自动化与数据提取,所有工作都围绕一个可部署单元展开——Actor。官网把产品定位为「面向 AI 的最大可信工具市场」,提供实时网页数据、竞品追踪、线索生成、社交媒体监控以及与自有应用和智能体的集成。落到实处只有两种用法:要么直接运行别的开发者已经发布好的现成 Actor,要么自己写一个部署上去。
平台由捷克公司 Apify Technologies s.r.o. 运营,注册地在布拉格 Vodičkova 704/36,公司编号 04788290。它的历史比这一波 AI 工具里的大多数产品都长:Apify 由 Jan Čurn 与 Jakub Balada 于 2015 年在美国 Mountain View 的 Y Combinator Fellowship 期间创立,团队 2016 年迁回捷克并围绕产品建立公司。这个出身很关键——Apify 比大模型热潮早了好几年,本质上先是一家抓取基础设施公司,如今面向 AI 的定位是叠加在成熟爬虫基建之上的一层,而不是新产品换皮。
公司公开自报的规模是:全球 8 万客户、每月处理超过 1 PB 数据、商店内 61,525 个现成 Actor。这些属于厂商自报数字而非经审计指标,引用价值主要在于说明市场体量的数量级——而这恰恰是该平台最独特之处。
需要先说清楚:这是开发者产品,不是消费级应用。用评估「点几下就能用的抓取工具」的方式来评估 Apify 没有意义,它的抽象层、计费模型与故障形态都默认使用者愿意读文档、能推算内存分配、会调试一次「返回行数比预期少」的运行。
平台上的一切都是 Apify Actor。官方文档给出的定义很精确:Actor 是无服务器云程序,接收结构化 JSON 输入,执行任务(网页抓取、浏览器自动化、数据处理等),并可选地产出结构化输出。可以在 Apify Console 手动运行、经 API 或 CLI 调用,也可以按计划定时执行,还能组合成更大的自动化流程。
其结构刻意保持常规:一个 Actor 由 Dockerfile(指明源码位置、如何构建与运行)、README 形式的文档、描述输入输出的 schema、内置存储系统的访问权限,以及名称、描述、作者、版本等元数据构成。因为契约本身就是「Docker 镜像 + JSON schema」,Actor 几乎可以用任何语言编写,并且 Actor 之间可以互相调用,从简单单元搭出复杂系统。
Actor 分公开与私有两种。私有 Actor 只属于你;公开 Actor 会出现在 Apify Store 供任何人运行。正是这一条区分,把平台从托管服务变成了市场。
Store 才是 Apify 真正的护城河。用量最高的 Actor 是针对具体站点的抓取器,发布在各自的开发者命名空间下——clockworks/tiktok-scraper、compass/crawler-google-places、apify/instagram-scraper、apify/website-content-crawler——每个都标注用户数与星级评分,让你在投入前先看到采纳度。以谷歌地图抓取器为例,首页列表显示 568K 用户、4.7 分(1,764 条评分)。
这一点在运维上的意义比表面看起来更大。针对具体站点的抓取器会「腐坏」:目标站点一改结构或收紧反爬策略,抓取器就失效。选用一个 Store Actor,本质上是在押注别人的维护承诺,所以评分和用户数才是第一眼要看的数字。一个热门且仍在维护的 Actor,和一个功能列表相同却已弃坑的 Actor,完全是两回事。
Apify Proxy 是单独计价的产品线,不是附带功能。文档说得很直白:Apify Proxy 让你在抓取时轮换 IP 地址以规避地域封锁,可在 Actor 内使用,也可用于任何支持 HTTP 代理的应用;Apify 会监控 IP 池健康状况并轮换地址,防止基于 IP 的封禁。
共有四类,各自的成本与被封概率不同。数据中心代理最快也最便宜,代价是其他用户的行为可能连累这些 IP 被封。住宅代理使用分布在全球家庭与办公场所的 IP,最不容易被封。Google SERP 代理专门用于抓取搜索结果页,可选择国家与语言。Unblocker 通过内建智能路由自动绕过反爬与验证码系统,你不需要自己识别或破解质询。
运行结果写入三类存储——数据集、键值存储、请求队列——各自按「时长存储 + 读/写/列举操作次数」计费。XLSX、CSV 等表格导出最多 2000 列。命名存储无限期保留,未命名存储适用「限制与注意事项」中的保留规则。
控制面上,平台本身就是一套数据采集 API:REST 接口供代码驱动、Webhooks 在运行成功或失败时触发外部事件,以及 GitHub 集成用仓库事件触发运行。Actor 之间也能互相触发,这就是无需外部编排器也能搭出多步流水线的原因。
Apify 的开源投入是实打实的,不是摆个仓库应付。官网写明:Apify 与 Python 和 JavaScript 都配合良好,同样兼容 Playwright、Puppeteer、Selenium、Scrapy,以及 Crawlee——我们自研的网页爬取与浏览器自动化库。Crawlee 是 Apify 自家的库,采集时首页计数显示 25,453 个 GitHub star;它完全可以脱离 Apify 独立运行,因此成了一个低承诺的入口。
AI 侧的入口是官方集成文档列出的 Apify MCP server,它把 Actor 与存储暴露给任意兼容 MCP 的 AI 客户端。编辑器与命令行插件覆盖 Claude Code CLI、GitHub Copilot、Cursor 以及 Codex CLI 与 OpenCode。面向智能体框架,官方提供 OpenAI Agents SDK 与 LangChain 的工具封装,也支持 Vercel AI SDK 与 Google ADK。向量索引一侧则接入了 Pinecone。这就是「面向 AI 的工具」这一定位背后的具体内容:Actor 成为智能体可调用的工具。
Website Content Crawler 这个 Actor 的存在目的就是爬取网站、提取文本内容,喂给 AI 模型、LLM 应用、向量数据库或 RAG 管线,支持 Markdown 输出与 HTML 清洗。配合 MCP server 或 LangChain 封装,这是目前最常见的新建模式:Apify 负责爬取、渲染与解封锁,下游栈负责切块、向量化与检索。
定时运行的 Actor 加上 Webhooks,让周期性监控变得直接——电商价格追踪、平台商品变动、评论监控、竞品页面 diff。调度、重试与存储这套机器,正是你自建时不得不写并持续照看的部分。
谷歌地图和社交平台抓取器是 Store 上用量最高的一类,典型用途是用公开挂出的商户信息构建潜客名单。这也是法律边界最锋利的场景,因为商户联系记录常常包含个人数据——围绕它搭管线之前,务必先读「限制与注意事项」。
Apify 经营的是双边市场。官网给开发者的说法很明确:发布 Actor 免费,算力由使用方付费,新创作者可获得 500 美元平台额度。Apify 还负责支付、税务与开票,按月结算净额,这让一个持续维护的抓取器可以变成小型产品生意,而不必承担 SaaS 的运营开销。
不适合期待「点选即用」的非技术用户。独立评测反复提到学习曲线,尤其计费模型默认你会主动推算内存、运行时长与代理消耗。
Apify 是托管云平台,通过浏览器里的 Apify Console 使用,没有桌面或移动端应用。程序化访问经 REST API、官方 API 客户端与 Apify CLI 进行,并提供 JavaScript 与 Python SDK。Actor 本身是 Docker 镜像,因此运行时由你自己打包决定。
底层爬取库 Crawlee 是开源的,凡能跑 Node.js 或 Python 的地方都能运行——包括完全脱离 Apify 平台。编辑器与智能体集成覆盖 Claude Code CLI、VS Code 中的 GitHub Copilot、Cursor、Codex CLI 与 OpenCode,MCP server 则把 Actor 接入任意兼容 MCP 的客户端。工作流侧连接了 Zapier、Make、n8n、GitHub、Google Sheets、Google Drive 与 Slack。
Apify 采用「预付额度 + 超量按量计费」模型。免费档 0 美元,含 5 美元额度可用于 Apify Store 或自己的 Actor,单价 0.2 美元/CU,社区支持,无需信用卡。Starter 每月 29 美元含 29 美元用量,单价同为 0.2 美元/CU。Scale 每月 199 美元含 199 美元用量,单价 0.16 美元/CU,配优先在线支持。Business 每月 999 美元含 999 美元用量,单价 0.13 美元/CU,配专属客户经理。Enterprise 为定制报价,增加 SLA 与单点登录。年付宣传为九折。
比标价更要紧的是两条结构性细节。其一,未用完的额度不滚存到下个计费周期,周期结束即失效——月度额度是用不完就作废。其二,超量行为按档位差异极大:付费用户可继续使用并按可配置上限计入超量账单,免费用户则被封停至下个月度周期开始。
Store 上的 Actor 会在平台用量之上叠加第二层计费。文档描述了三种模式:pay per event,按 Actor 作者定义的事件计费,例如产出一条结果或启动一次运行;pay per usage,开发者不额外收费,你只付平台资源;以及 rental,在平台用量之外按月向开发者付固定租金。注意定价页 FAQ 只描述了前两种——文档是更完整的信息源,而具体适用哪种以每个 Actor 自己的页面为准。
代理与存储单独计量。住宅代理在 Free 与 Starter 档为 8 美元/GB,Scale 档 7.5 美元,Business 档 7 美元。SERP 代理从 2.5 美元降至 1.7 美元/千次,Unblocker 从 1.5 美元降至 1 美元/千请求。数据集时长存储在低档位为每 1,000 GB-小时 1.00 美元,请求队列为 4.00 美元。学生、初创与非营利组织宣传有 30% 折扣。
Apify 的差异化在于三者叠加:一个极大的现成 Actor 市场、一个可独立采用的开源库,以及从代理到存储的全套基建。代价是计费复杂度,以及对第三方 Actor 维护者的依赖。
Apify 是捷克公司 Apify Technologies s.r.o. 提供的云平台,用于网页抓取、浏览器自动化与数据提取。工作被封装成 Actor——接收 JSON 输入并产出结构化输出的无服务器云程序——你要么从数以万计的现成 Actor 市场里挑一个,要么自己写一个部署上去。
大体上是。填个表单运行现成的 Store Actor,非开发者也能上手;但理解成本、诊断失败、把输出接进自己的系统,都默认你具备技术素养。评测普遍提到,超出基础用法就会遇到明显的学习曲线。真正的非技术用户更适合 Octoparse 这类可视化工具。
分两层。平台层按算力单元(1024MB 内存运行 1 小时等于 1 CU)、代理流量、存储操作与数据传输计费。你的套餐含一笔预付额度——免费 5 美元、Starter 29 美元、Scale 199 美元、Business 999 美元——CU 单价从 0.2 美元递减到 0.13 美元。第二层是 Actor 自身的模式:按事件、按用量,或按月租金。未用完的额度每期作废。
用于评估和小型一次性任务是够的:每月 5 美元额度、无需信用卡,在便宜的 Actor 上能跑不少次。但只要涉及周期性任务就很紧张,而且有两条会咬人的约束——超出额度会被封停到下个周期,且只保留最近 10 次运行、期限 4 个月。
是跑在 Apify 云上的容器化程序,带有声明式的输入 schema 与输出去向。因为契约是「Docker 镜像 + JSON」,它可以用任何语言编写,可按需或按计划运行,并能与其他 Actor 串联。正是这种统一性,才让一个市场得以成立。
Apify 自己公开的立场是:抓取公开可得的数据通常合法,而登录后的数据、个人数据、知识产权与机密数据需要真正的谨慎,可能受服务条款或国家与国际法规保护。平台并不为你的具体用途背书:条款要求你只处理有权访问且符合适用法律的数据。凡涉及个人数据或商业敏感目标,请自行获取法律意见。
隐私政策载明,Apify 作为数据处理者代客户处理的个人数据,未经客户单独同意不会用于训练 AI 模型。另外针对平台自身的 AI 功能,条款规定你的输入与由此产生的输出不会用于训练任何基础模型。你的运行数据存放在平台存储中,适用你所在套餐的保留规则。
部分可以。Apify 的爬取与浏览器自动化库 Crawlee 是开源的,无需 Apify 账号即可在自有基础设施上运行。放弃的是被托管的那一层——代理轮换、调度、存储、监控与 Store。不少团队先在本地用 Crawlee 做原型,等到确实需要托管层时再部署到 Apify。
因 Actor 而异,因为它们由独立开发者发布。每个详情页上可见的信号——星级评分、评分条数、用户数与最近更新时间——是实际可用的判断依据。来自成熟发布者、用量大且近期更新过的 Actor,与无人维护的表现天差地别;一个自目标站点改版后就没再更新的抓取器,多半已经坏了。
独立评测中反复出现两条。第一是成本可预测性:多层计费模型让人很难在跑之前预估月度账单。第二是学习曲线,尤其集中在进阶功能与自动化工作流上。设置最高扣费上限、排计划前先试跑,能解决第一条的大部分;第二条则是开发者平台的固有属性。