Apify 是一個網頁擷取平台,同時涵蓋瀏覽器自動化與資料提取,所有工作都圍繞一個可部署單元展開——Actor。官網把產品定位為「面向 AI 的最大可信工具市集」,提供即時網頁資料、競品追蹤、名單開發、社群媒體監控,以及與自有應用和智慧代理的整合。落到實處只有兩種用法:要麼直接執行其他開發者已經發布好的現成 Actor,要麼自己寫一個部署上去。
平台由捷克公司 Apify Technologies s.r.o. 營運,註冊地在布拉格 Vodičkova 704/36,公司編號 04788290。它的歷史比這一波 AI 工具裡的多數產品都長:Apify 由 Jan Čurn 與 Jakub Balada 於 2015 年在美國 Mountain View 的 Y Combinator Fellowship 期間創立,團隊 2016 年遷回捷克並圍繞產品建立公司。這個出身很關鍵——Apify 比大型語言模型熱潮早了好幾年,本質上先是一家擷取基礎設施公司,如今面向 AI 的定位是疊加在成熟爬蟲基建之上的一層,而不是新產品換皮。
公司公開自報的規模是:全球 8 萬客戶、每月處理超過 1 PB 資料、市集內 61,525 個現成 Actor。這些屬於廠商自報數字而非經稽核指標,引用價值主要在於說明市集體量的數量級——而這恰恰是該平台最獨特之處。
需要先說清楚:這是開發者產品,不是消費級應用。用評估「點幾下就能用的擷取工具」的方式來評估 Apify 沒有意義,它的抽象層、計費模型與故障型態都預設使用者願意讀文件、能推算記憶體配置、會除錯一次「回傳筆數比預期少」的執行。
平台上的一切都是 Apify Actor。官方文件給出的定義很精確:Actor 是無伺服器雲端程式,接收結構化 JSON 輸入,執行任務(網頁擷取、瀏覽器自動化、資料處理等),並可選地產出結構化輸出。可以在 Apify Console 手動執行、經 API 或 CLI 呼叫,也可以按排程定時執行,還能組合成更大的自動化流程。
其結構刻意保持常規:一個 Actor 由 Dockerfile(指明原始碼位置、如何建置與執行)、README 形式的文件、描述輸入輸出的 schema、內建儲存系統的存取權限,以及名稱、描述、作者、版本等中繼資料構成。因為契約本身就是「Docker 映像檔 + JSON schema」,Actor 幾乎可以用任何語言撰寫,並且 Actor 之間可以互相呼叫,從簡單單元搭出複雜系統。
Actor 分公開與私有兩種。私有 Actor 只屬於你;公開 Actor 會出現在 Apify Store 供任何人執行。正是這一條區分,把平台從代管服務變成了市集。
Store 才是 Apify 真正的護城河。用量最高的 Actor 是針對特定站點的擷取器,發布在各自的開發者命名空間下——clockworks/tiktok-scraper、compass/crawler-google-places、apify/instagram-scraper、apify/website-content-crawler——每個都標註使用者數與星級評分,讓你在投入前先看到採用度。以 Google 地圖擷取器為例,首頁列表顯示 568K 使用者、4.7 分(1,764 則評分)。
這一點在維運上的意義比表面看起來更大。針對特定站點的擷取器會「腐化」:目標站點一改結構或收緊反爬策略,擷取器就失效。選用一個 Store Actor,本質上是在押注別人的維護承諾,所以評分和使用者數才是第一眼要看的數字。一個熱門且仍在維護的 Actor,和一個功能列表相同卻已棄坑的 Actor,完全是兩回事。
Apify Proxy 是單獨計價的產品線,不是附帶功能。文件說得很直白:Apify Proxy 讓你在擷取時輪換 IP 位址以規避地域封鎖,可在 Actor 內使用,也可用於任何支援 HTTP 代理的應用;Apify 會監控 IP 池健康狀況並輪換位址,防止基於 IP 的封鎖。
共有四類,各自的成本與被封機率不同。資料中心代理最快也最便宜,代價是其他使用者的行為可能連累這些 IP 被封。住宅代理使用分布在全球家庭與辦公場所的 IP,最不容易被封。Google SERP 代理專門用於擷取搜尋結果頁,可選擇國家與語言。Unblocker 透過內建智慧路由自動繞過反爬與驗證碼系統,你不需要自己辨識或破解質詢。
執行結果寫入三類儲存——資料集、鍵值儲存、請求佇列——各自按「時長儲存 + 讀/寫/列舉操作次數」計費。XLSX、CSV 等表格匯出最多 2000 欄。具名儲存無限期保留,未具名儲存適用「限制與注意事項」中的保留規則。
控制面上,平台本身就是一套資料擷取 API:REST 介面供程式碼驅動、Webhooks 在執行成功或失敗時觸發外部事件,以及 GitHub 整合用儲存庫事件觸發執行。Actor 之間也能互相觸發,這就是無需外部編排器也能搭出多步驟流水線的原因。
Apify 的開源投入是實打實的,不是擺個儲存庫應付。官網寫明:Apify 與 Python 和 JavaScript 都配合良好,同樣相容 Playwright、Puppeteer、Selenium、Scrapy,以及 Crawlee——我們自研的網頁爬取與瀏覽器自動化函式庫。Crawlee 是 Apify 自家的函式庫,採集時首頁計數顯示 25,453 個 GitHub star;它完全可以脫離 Apify 獨立執行,因此成了一個低承諾的入口。
AI 側的入口是官方整合文件列出的 Apify MCP server,它把 Actor 與儲存暴露給任意相容 MCP 的 AI 用戶端。編輯器與命令列外掛涵蓋 Claude Code CLI、GitHub Copilot、Cursor 以及 Codex CLI 與 OpenCode。面向智慧代理框架,官方提供 OpenAI Agents SDK 與 LangChain 的工具封裝,也支援 Vercel AI SDK 與 Google ADK。向量索引一側則接入了 Pinecone。這就是「面向 AI 的工具」這一定位背後的具體內容:Actor 成為智慧代理可呼叫的工具。
Website Content Crawler 這個 Actor 的存在目的就是爬取網站、提取文字內容,餵給 AI 模型、LLM 應用、向量資料庫或 RAG 管線,支援 Markdown 輸出與 HTML 清理。搭配 MCP server 或 LangChain 封裝,這是目前最常見的新建模式:Apify 負責爬取、算繪與解封鎖,下游堆疊負責切塊、向量化與檢索。
定時執行的 Actor 加上 Webhooks,讓週期性監控變得直接——電商價格追蹤、平台商品變動、評論監控、競品頁面比對。排程、重試與儲存這套機制,正是你自建時不得不寫並持續照看的部分。
Google 地圖和社群平台擷取器是 Store 上用量最高的一類,典型用途是用公開揭露的商家資訊建立潛在客戶名單。這也是法律邊界最鋒利的情境,因為商家聯絡紀錄常常包含個人資料——圍繞它搭管線之前,務必先讀「限制與注意事項」。
Apify 經營的是雙邊市集。官網給開發者的說法很明確:發布 Actor 免費,運算資源由使用方付費,新創作者可獲得 500 美元平台額度。Apify 還負責付款、稅務與開立發票,按月結算淨額,這讓一個持續維護的擷取器可以變成小型產品生意,而不必承擔 SaaS 的營運開銷。
不適合期待「點選即用」的非技術使用者。獨立評測反覆提到學習曲線,尤其計費模型預設你會主動推算記憶體、執行時長與代理消耗。
Apify 是代管雲端平台,透過瀏覽器裡的 Apify Console 使用,沒有桌面或行動端應用。程式化存取經 REST API、官方 API 用戶端與 Apify CLI 進行,並提供 JavaScript 與 Python SDK。Actor 本身是 Docker 映像檔,因此執行環境由你自己打包決定。
底層爬取函式庫 Crawlee 是開源的,凡能跑 Node.js 或 Python 的地方都能執行——包括完全脫離 Apify 平台。編輯器與智慧代理整合涵蓋 Claude Code CLI、VS Code 中的 GitHub Copilot、Cursor、Codex CLI 與 OpenCode,MCP server 則把 Actor 接入任意相容 MCP 的用戶端。工作流側連接了 Zapier、Make、n8n、GitHub、Google Sheets、Google Drive 與 Slack。
Apify 採用「預付額度 + 超量按量計費」模型。免費方案 0 美元,含 5 美元額度可用於 Apify Store 或自己的 Actor,單價 0.2 美元/CU,社群支援,無需信用卡。Starter 每月 29 美元含 29 美元用量,單價同為 0.2 美元/CU。Scale 每月 199 美元含 199 美元用量,單價 0.16 美元/CU,配優先線上支援。Business 每月 999 美元含 999 美元用量,單價 0.13 美元/CU,配專屬客戶經理。Enterprise 為客製報價,增加 SLA 與單一登入。年付宣傳為九折。
比標價更要緊的是兩條結構性細節。其一,未用完的額度不會滾存到下個計費週期,週期結束即失效——月度額度是用不完就作廢。其二,超量行為按方案差異極大:付費使用者可繼續使用並按可設定上限計入超量帳單,免費使用者則被停用至下個月度週期開始。
Store 上的 Actor 會在平台用量之上疊加第二層計費。文件描述了三種模式:pay per event,按 Actor 作者定義的事件計費,例如產出一筆結果或啟動一次執行;pay per usage,開發者不額外收費,你只付平台資源;以及 rental,在平台用量之外按月向開發者付固定租金。注意定價頁 FAQ 只描述了前兩種——文件是更完整的資訊來源,而具體適用哪種以每個 Actor 自己的頁面為準。
代理與儲存單獨計量。住宅代理在 Free 與 Starter 等級為 8 美元/GB,Scale 等級 7.5 美元,Business 等級 7 美元。SERP 代理從 2.5 美元降至 1.7 美元/千次,Unblocker 從 1.5 美元降至 1 美元/千請求。資料集時長儲存在低等級為每 1,000 GB-小時 1.00 美元,請求佇列為 4.00 美元。學生、新創與非營利組織宣傳有 30% 折扣。
Apify 的差異化在於三者疊加:一個極大的現成 Actor 市集、一個可獨立採用的開源函式庫,以及從代理到儲存的整套基建。代價是計費複雜度,以及對第三方 Actor 維護者的依賴。
Apify 是捷克公司 Apify Technologies s.r.o. 提供的雲端平台,用於網頁擷取、瀏覽器自動化與資料提取。工作被封裝成 Actor——接收 JSON 輸入並產出結構化輸出的無伺服器雲端程式——你要麼從數以萬計的現成 Actor 市集裡挑一個,要麼自己寫一個部署上去。
大體上是。填個表單執行現成的 Store Actor,非開發者也能上手;但理解成本、診斷失敗、把輸出接進自己的系統,都預設你具備技術素養。評測普遍提到,超出基礎用法就會遇到明顯的學習曲線。真正的非技術使用者更適合 Octoparse 這類視覺化工具。
分兩層。平台層按運算單元(1024MB 記憶體執行 1 小時等於 1 CU)、代理流量、儲存操作與資料傳輸計費。你的方案含一筆預付額度——免費 5 美元、Starter 29 美元、Scale 199 美元、Business 999 美元——CU 單價從 0.2 美元遞減到 0.13 美元。第二層是 Actor 自身的模式:按事件、按用量,或按月租金。未用完的額度每期作廢。
用於評估和小型一次性任務是夠的:每月 5 美元額度、無需信用卡,在便宜的 Actor 上能跑不少次。但只要涉及週期性任務就很吃緊,而且有兩條會咬人的約束——超出額度會被停用到下個週期,且只保留最近 10 次執行、期限 4 個月。
是跑在 Apify 雲端上的容器化程式,帶有宣告式的輸入 schema 與輸出去向。因為契約是「Docker 映像檔 + JSON」,它可以用任何語言撰寫,可按需或按排程執行,並能與其他 Actor 串聯。正是這種一致性,才讓一個市集得以成立。
Apify 自己公開的立場是:擷取公開可得的資料通常合法,而登入後的資料、個人資料、智慧財產權與機密資料需要真正的謹慎,可能受服務條款或國家與國際法規保護。平台並不為你的具體用途背書:條款要求你只處理有權存取且符合適用法律的資料。凡涉及個人資料或商業敏感目標,請自行取得法律意見。
隱私政策載明,Apify 作為資料處理者代客戶處理的個人資料,未經客戶單獨同意不會用於訓練 AI 模型。另外針對平台自身的 AI 功能,條款規定你的輸入與由此產生的輸出不會用於訓練任何基礎模型。你的執行資料存放在平台儲存中,適用你所在方案的保留規則。
部分可以。Apify 的爬取與瀏覽器自動化函式庫 Crawlee 是開源的,無需 Apify 帳號即可在自有基礎設施上執行。放棄的是被代管的那一層——代理輪換、排程、儲存、監控與 Store。不少團隊先在本地用 Crawlee 做原型,等到確實需要代管層時再部署到 Apify。
因 Actor 而異,因為它們由獨立開發者發布。每個詳細頁上可見的訊號——星級評分、評分則數、使用者數與最近更新時間——是實際可用的判斷依據。來自成熟發布者、用量大且近期更新過的 Actor,與無人維護的表現天差地別;一個自目標站點改版後就沒再更新的擷取器,多半已經壞了。
獨立評測中反覆出現兩條。第一是成本可預測性:多層計費模型讓人很難在執行之前預估月度帳單。第二是學習曲線,尤其集中在進階功能與自動化工作流上。設定最高扣款上限、排排程前先試跑,能解決第一條的大部分;第二條則是開發者平台的固有屬性。