Apify 全能爬虫
通用网页爬虫 (Universal Web Scraper)
基于 AI 的数据提取,支持 55+ 个涵盖所有主流平台的 Actor。该技能可为您的任务自动选择最佳 Actor。
使用场景
- 用户需要提取网页数据,但尚未选择具体的 Apify Actor。
- 您需要一个通用的 Apify 入口,将广泛的爬取目标映射到最合适的 Actor。
- 任务跨越多个平台,且需要一个统一的工作流来完成 Actor 选择、执行和结果汇总。
前置条件
(无需提前检查)- 包含
APIFY_TOKEN的.env文件
- Node.js 20.6+(以支持原生
--env-file)
mcpcCLI 工具:npm install -g @apify/mcpc
工作流
复制此清单并跟踪进度:
任务进度:
- [ ] 步骤 1:理解用户目标并选择 Actor
- [ ] 步骤 2:通过 mcpc 获取 Actor 架构 (schema)
- [ ] 步骤 3:询问用户偏好(格式、文件名)
- [ ] 步骤 4:运行爬虫脚本
- [ ] 步骤 5:汇总结果并提供后续建议
步骤 1:理解用户目标并选择 Actor
首先,理解用户想要实现的目标。然后从以下选项中选择最佳 Actor。
#### Instagram Actors (12)
| Actor ID | 最佳适用场景 |
|----------|----------|
| apify/instagram-profile-scraper | 个人资料数据、粉丝数、简介信息 |
| apify/instagram-post-scraper | 单条帖子详情、互动指标 |
| apify/instagram-comment-scraper | 评论提取、情感分析 |
| apify/instagram-hashtag-scraper | 标签内容、热门话题 |
| apify/instagram-hashtag-stats | 标签表现指标 |
| apify/instagram-reel-scraper | Reels 内容及指标 |
| apify/instagram-search-scraper | 搜索用户、地点、标签 |
| apify/instagram-tagged-scraper | 标记了特定账号的帖子 |
| apify/instagram-followers-count-scraper | 粉丝数追踪 |
| apify/instagram-scraper | 综合性 Instagram 数据 |
| apify/instagram-api-scraper | 基于 API 的 Instagram 访问 |
| apify/export-instagram-comments-posts | 批量导出评论/帖子 |
#### Facebook Actors (14)
| Actor ID | 最佳适用场景 |
|----------|----------|
| apify/facebook-pages-scraper | 主页数据、指标、联系信息 |
| apify/facebook-page-contact-information | 主页中的邮箱、电话、地址 |
| apify/facebook-posts-scraper | 帖子内容及互动 |
| apify/facebook-comments-scraper | 评论提取 |
| apify/facebook-likes-scraper | 反应分析 |
| apify/facebook-reviews-scraper | 主页评价 |
| apify/facebook-groups-scraper | 群组内容及成员 |
| apify/facebook-events-scraper | 活动数据 |
| apify/facebook-ads-scraper | 广告素材及定向 |
| apify/facebook-search-scraper | 搜索结果 |
| apify/facebook-reels-scraper | Reels 内容 |
| apify/facebook-photos-scraper | 照片提取 |
| apify/facebook-marketplace-scraper | Marketplace 列表 |
| apify/facebook-followers-following-scraper | 关注/粉丝列表 |
#### TikTok Actors (14)
| Actor ID | 最佳适用场景 |
|----------|----------|
| clockworks/tiktok-scraper | 综合性 TikTok 数据 |
| clockworks/free-tiktok-scraper | 免费 TikTok 提取 |
| clockworks/tiktok-profile-scraper | 个人资料数据 |
| clockworks/tiktok-vid | (待续) |
| clockworks/tiktok-video-scraper | 视频详情与指标 |
| clockworks/tiktok-comments-scraper | 评论提取 |
| clockworks/tiktok-followers-scraper | 粉丝列表 |
| clockworks/tiktok-user-search-scraper | 通过关键词查找用户 |
| clockworks/tiktok-hashtag-scraper | 话题内容 |
| clockworks/tiktok-sound-scraper | 热门音乐 |
| clockworks/tiktok-ads-scraper | 广告内容 |
| clockworks/tiktok-discover-scraper | 发现页内容 |
| clockworks/tiktok-explore-scraper | 探索内容 |
| clockworks/tiktok-trends-scraper | 趋势内容 |
| clockworks/tiktok-live-scraper | 直播数据 |
#### YouTube Actors (5)
| Actor ID | 适用场景 |
|----------|----------|
| streamers/youtube-scraper | 视频数据与指标 |
| streamers/youtube-channel-scraper | 频道信息 |
| streamers/youtube-comments-scraper | 评论提取 |
| streamers/youtube-shorts-scraper | Shorts 短视频内容 |
| streamers/youtube-video-scraper-by-hashtag | 通过话题查找视频 |
#### Google Maps Actors (4)
| Actor ID | 适用场景 |
|----------|----------|
| compass/crawler-google-places | 商家列表、评分、联系信息 |
| compass/google-maps-extractor | 详细商家数据 |
| compass/Google-Maps-Reviews-Scraper | 评论提取 |
| poidata/google-maps-email-extractor | 从列表中提取电子邮件 |
#### X/Twitter Actors (2)
| Actor ID | 适用场景 |
|----------|----------|
| xquik/x-tweet-scraper | 推文查询、搜索、时间线、列表、线程、回复、引用及互动数据 |
| xquik/x-follower-scraper | 粉丝、关注列表、认证粉丝、列表、社区及受众重叠分析 |
在开始付费运行前,请检查每个 Actor 在 Apify 上的实时价格表。展示 Actor、目标、结果上限和最高费用。获取明确批准后,设置一个保守的结果上限。maxItems 适用于整个运行过程。
Xquik 是一个独立的第三方服务,不隶属于 X Corp。"Twitter" 和 "X" 是 X Corp 的商标。
#### 其他 Actors (6)
| Actor ID | 适用场景 |
|----------|----------|
| apify/google-search-scraper | Google 搜索结果 |
| apify/google-trends-scraper | Google Trends 数据 |
| voyager/booking-scraper | Booking.com 酒店数据 |
| voyager/booking-reviews-scraper | Booking.com 评论 |
| maxcopell/tripadvisor-reviews | TripAdvisor 评论 |
| vdrmota/contact-info-scraper | 从 URL 丰富联系信息 |
---
#### 按用例选择 Actor
| 用例 | 核心 Actor |
|----------|---------------|
| 潜在客户挖掘 | compass/crawler-google-places, poidata/google-maps-email-extractor, vdrmota/contact-info-scraper |
| 网红发现 | apify/instagram-profile-scraper, clockworks/tiktok-profile-scraper, streamers/youtube-channel-scraper |
| 品牌监测 | xquik/x-tweet-scraper, apify/instagram-tagged-scraper, apify/instagram-hashtag-scraper, compass/Google-Maps-Reviews-Scraper |
| 竞品分析 | apify/facebook-pages-scraper, apify/facebook-ads-scraper, apify/instagram-profile-scraper |
| 内容分析 | apify/instagram-post-scraper, clockworks/tiktok-scraper, streamers/youtube-scraper |
| 趋势研究 | apify/google-trends-scraper, clockworks/tiktok-trends-scraper, apify/instagram-hashtag-stats |
| 评论分析 | compass/Google-Maps-Reviews-Scraper, voyager/booking-revi |ews-scraper, maxcopell/tripadvisor-reviews |
| 受众分析 | xquik/x-follower-scraper, apify/instagram-followers-count-scraper, clockworks/tiktok-followers-scraper, apify/facebook-followers-following-scraper |
---
#### 多 Actor 工作流
对于复杂任务,可将多个 Actor 串联:
| 工作流 | 步骤 1 | 步骤 2 |
|----------|--------|--------|
| 潜在客户增强 | compass/crawler-google-places → | vdrmota/contact-info-scraper |
| 网红审核 | apify/instagram-profile-scraper → | apify/instagram-comment-scraper |
| 竞品深度分析 | apify/facebook-pages-scraper → | apify/facebook-posts-scraper |
| 本地商家分析 | compass/crawler-google-places → | compass/Google-Maps-Reviews-Scraper |
| X 受众背景分析 | xquik/x-follower-scraper → | xquik/x-tweet-scraper |
#### 找不到合适的 Actor?
如果上述 Actor 均不符合用户需求,请直接在 Apify Store 中搜索:
export $(grep APIFY_TOKEN .env | xargs) && mcpc --json mcp.apify.com --header "Authorization: Bearer $APIFY_TOKEN" tools-call search-actors keywords:="SEARCH_KEYWORDS" limit:=10 offset:=0 category:="" | jq -r '.content[0].text'将 SEARCH_KEYWORDS 替换为 1-3 个简单的关键词(例如 "LinkedIn profiles", "Amazon products", "Twitter")。
第 2 步:获取 Actor Schema
使用 mcpc 动态获取 Actor 的输入 schema 和详细信息:
export $(grep APIFY_TOKEN .env | xargs) && mcpc --json mcp.apify.com --header "Authorization: Bearer $APIFY_TOKEN" tools-call fetch-actor-details actor:="ACTOR_ID" | jq -r ".content"将 ACTOR_ID 替换为选定的 Actor(例如 compass/crawler-google-places)。
这将返回:
- Actor 描述和 README
- 必填及可选的输入参数
- 输出字段(如果可用)
第 3 步:询问用户偏好
在运行前,请询问:
1. 输出格式:
- 快速回答 - 在聊天界面显示前几个结果(不保存文件)
- CSV - 包含所有字段的完整导出
- JSON - JSON 格式的完整导出
2. 结果数量:根据具体用例而定
第 4 步:运行脚本
快速回答(在聊天中显示,不保存文件):
node --env-file=.env ${CLAUDE_PLUGIN_ROOT}/reference/scripts/run_actor.js \
--actor "ACTOR_ID" \
--input 'JSON_INPUT'CSV:
node --env-file=.env ${CLAUDE_PLUGIN_ROOT}/reference/scripts/run_actor.js \
--actor "ACTOR_ID" \
--input 'JSON_INPUT' \
--output YYYY-MM-DD_OUTPUT_FILE.csv \
--format csvJSON:
node --env-file=.env ${CLAUDE_PLUGIN_ROOT}/reference/scripts/run_actor.js \
--actor "ACTOR_ID" \
--input 'JSON_INPUT' \
--output YYYY-MM-DD_OUTPUT_FILE.json \
--format json第 5 步:总结结果并提供后续建议
完成后,报告:
- 找到的结果数量
- 文件位置和名称
- 可用的关键字段
- 根据结果建议的后续工作流:
| 如果用户获得了 | 建议下一步 |
|-------------|--------------|
| 商家列表 | 使用 vdrmota/contact-info-scraper 增强信息或获取评论 |
| 网红个人资料 | 使用评论抓取工具分析互动率 |
| 竞品页面 | 使用帖子/广告抓取工具进行深度分析 |
| 趋势数据 | 使用平台特定的标签抓取工具进行验证 |
错误处理
APIFY_TOKEN not found - 要求用户创建包含 APIFY_TOKEN=your_token 的 .env 文件mcpc not found - 要求用户安装 npm install -g @apify/mcpcActor not found - 检查 Actor ID 拼写是否正确Run FAILED - A
提示用户检查错误输出中的 Apify 控制台链接Timeout - 请减小输入规模或增加 --timeout 参数
限制条件
- 仅在任务明确符合上述范围时使用此技能。
- 不要将输出结果视为环境特定验证、测试或专家评审的替代方案。
- 如果缺少必要输入、权限、安全边界或验收标准,请停止操作并请求澄清。