Apify 全能爬虫

apify-ultimate-scraper
分类数据
作者Agentic Awesome Skills 社区
许可MIT
评分4.40/5
使用10.1K

通用网页爬虫 (Universal Web Scraper)

基于 AI 的数据提取,支持 55+ 个涵盖所有主流平台的 Actor。该技能可为您的任务自动选择最佳 Actor。

使用场景

  • 用户需要提取网页数据,但尚未选择具体的 Apify Actor。
  • 您需要一个通用的 Apify 入口,将广泛的爬取目标映射到最合适的 Actor。
  • 任务跨越多个平台,且需要一个统一的工作流来完成 Actor 选择、执行和结果汇总。

前置条件

(无需提前检查)
  • 包含 APIFY_TOKEN.env 文件
  • Node.js 20.6+(以支持原生 --env-file
  • mcpc CLI 工具:npm install -g @apify/mcpc

工作流

复制此清单并跟踪进度:

code
任务进度:
  • [ ] 步骤 1:理解用户目标并选择 Actor
  • [ ] 步骤 2:通过 mcpc 获取 Actor 架构 (schema)
  • [ ] 步骤 3:询问用户偏好(格式、文件名)
  • [ ] 步骤 4:运行爬虫脚本
  • [ ] 步骤 5:汇总结果并提供后续建议

步骤 1:理解用户目标并选择 Actor

首先,理解用户想要实现的目标。然后从以下选项中选择最佳 Actor。

#### Instagram Actors (12)

| Actor ID | 最佳适用场景 |
|----------|----------|
| apify/instagram-profile-scraper | 个人资料数据、粉丝数、简介信息 |
| apify/instagram-post-scraper | 单条帖子详情、互动指标 |
| apify/instagram-comment-scraper | 评论提取、情感分析 |
| apify/instagram-hashtag-scraper | 标签内容、热门话题 |
| apify/instagram-hashtag-stats | 标签表现指标 |
| apify/instagram-reel-scraper | Reels 内容及指标 |
| apify/instagram-search-scraper | 搜索用户、地点、标签 |
| apify/instagram-tagged-scraper | 标记了特定账号的帖子 |
| apify/instagram-followers-count-scraper | 粉丝数追踪 |
| apify/instagram-scraper | 综合性 Instagram 数据 |
| apify/instagram-api-scraper | 基于 API 的 Instagram 访问 |
| apify/export-instagram-comments-posts | 批量导出评论/帖子 |

#### Facebook Actors (14)

| Actor ID | 最佳适用场景 |
|----------|----------|
| apify/facebook-pages-scraper | 主页数据、指标、联系信息 |
| apify/facebook-page-contact-information | 主页中的邮箱、电话、地址 |
| apify/facebook-posts-scraper | 帖子内容及互动 |
| apify/facebook-comments-scraper | 评论提取 |
| apify/facebook-likes-scraper | 反应分析 |
| apify/facebook-reviews-scraper | 主页评价 |
| apify/facebook-groups-scraper | 群组内容及成员 |
| apify/facebook-events-scraper | 活动数据 |
| apify/facebook-ads-scraper | 广告素材及定向 |
| apify/facebook-search-scraper | 搜索结果 |
| apify/facebook-reels-scraper | Reels 内容 |
| apify/facebook-photos-scraper | 照片提取 |
| apify/facebook-marketplace-scraper | Marketplace 列表 |
| apify/facebook-followers-following-scraper | 关注/粉丝列表 |

#### TikTok Actors (14)

| Actor ID | 最佳适用场景 |
|----------|----------|
| clockworks/tiktok-scraper | 综合性 TikTok 数据 |
| clockworks/free-tiktok-scraper | 免费 TikTok 提取 |
| clockworks/tiktok-profile-scraper | 个人资料数据 |
| clockworks/tiktok-vid | (待续) |
| clockworks/tiktok-video-scraper | 视频详情与指标 |
| clockworks/tiktok-comments-scraper | 评论提取 |
| clockworks/tiktok-followers-scraper | 粉丝列表 |
| clockworks/tiktok-user-search-scraper | 通过关键词查找用户 |
| clockworks/tiktok-hashtag-scraper | 话题内容 |
| clockworks/tiktok-sound-scraper | 热门音乐 |
| clockworks/tiktok-ads-scraper | 广告内容 |
| clockworks/tiktok-discover-scraper | 发现页内容 |
| clockworks/tiktok-explore-scraper | 探索内容 |
| clockworks/tiktok-trends-scraper | 趋势内容 |
| clockworks/tiktok-live-scraper | 直播数据 |

#### YouTube Actors (5)

| Actor ID | 适用场景 |
|----------|----------|
| streamers/youtube-scraper | 视频数据与指标 |
| streamers/youtube-channel-scraper | 频道信息 |
| streamers/youtube-comments-scraper | 评论提取 |
| streamers/youtube-shorts-scraper | Shorts 短视频内容 |
| streamers/youtube-video-scraper-by-hashtag | 通过话题查找视频 |

#### Google Maps Actors (4)

| Actor ID | 适用场景 |
|----------|----------|
| compass/crawler-google-places | 商家列表、评分、联系信息 |
| compass/google-maps-extractor | 详细商家数据 |
| compass/Google-Maps-Reviews-Scraper | 评论提取 |
| poidata/google-maps-email-extractor | 从列表中提取电子邮件 |

#### X/Twitter Actors (2)

| Actor ID | 适用场景 |
|----------|----------|
| xquik/x-tweet-scraper | 推文查询、搜索、时间线、列表、线程、回复、引用及互动数据 |
| xquik/x-follower-scraper | 粉丝、关注列表、认证粉丝、列表、社区及受众重叠分析 |

在开始付费运行前,请检查每个 Actor 在 Apify 上的实时价格表。展示 Actor、目标、结果上限和最高费用。获取明确批准后,设置一个保守的结果上限。maxItems 适用于整个运行过程。

Xquik 是一个独立的第三方服务,不隶属于 X Corp。"Twitter" 和 "X" 是 X Corp 的商标。

#### 其他 Actors (6)

| Actor ID | 适用场景 |
|----------|----------|
| apify/google-search-scraper | Google 搜索结果 |
| apify/google-trends-scraper | Google Trends 数据 |
| voyager/booking-scraper | Booking.com 酒店数据 |
| voyager/booking-reviews-scraper | Booking.com 评论 |
| maxcopell/tripadvisor-reviews | TripAdvisor 评论 |
| vdrmota/contact-info-scraper | 从 URL 丰富联系信息 |

---

#### 按用例选择 Actor

| 用例 | 核心 Actor |
|----------|---------------|
| 潜在客户挖掘 | compass/crawler-google-places, poidata/google-maps-email-extractor, vdrmota/contact-info-scraper |
| 网红发现 | apify/instagram-profile-scraper, clockworks/tiktok-profile-scraper, streamers/youtube-channel-scraper |
| 品牌监测 | xquik/x-tweet-scraper, apify/instagram-tagged-scraper, apify/instagram-hashtag-scraper, compass/Google-Maps-Reviews-Scraper |
| 竞品分析 | apify/facebook-pages-scraper, apify/facebook-ads-scraper, apify/instagram-profile-scraper |
| 内容分析 | apify/instagram-post-scraper, clockworks/tiktok-scraper, streamers/youtube-scraper |
| 趋势研究 | apify/google-trends-scraper, clockworks/tiktok-trends-scraper, apify/instagram-hashtag-stats |
| 评论分析 | compass/Google-Maps-Reviews-Scraper, voyager/booking-revi |
ews-scraper, maxcopell/tripadvisor-reviews |
| 受众分析 | xquik/x-follower-scraper, apify/instagram-followers-count-scraper, clockworks/tiktok-followers-scraper, apify/facebook-followers-following-scraper |

---

#### 多 Actor 工作流

对于复杂任务,可将多个 Actor 串联:

| 工作流 | 步骤 1 | 步骤 2 |
|----------|--------|--------|
| 潜在客户增强 | compass/crawler-google-places → | vdrmota/contact-info-scraper |
| 网红审核 | apify/instagram-profile-scraper → | apify/instagram-comment-scraper |
| 竞品深度分析 | apify/facebook-pages-scraper → | apify/facebook-posts-scraper |
| 本地商家分析 | compass/crawler-google-places → | compass/Google-Maps-Reviews-Scraper |
| X 受众背景分析 | xquik/x-follower-scraper → | xquik/x-tweet-scraper |

#### 找不到合适的 Actor?

如果上述 Actor 均不符合用户需求,请直接在 Apify Store 中搜索:

bash
export $(grep APIFY_TOKEN .env | xargs) && mcpc --json mcp.apify.com --header "Authorization: Bearer $APIFY_TOKEN" tools-call search-actors keywords:="SEARCH_KEYWORDS" limit:=10 offset:=0 category:="" | jq -r '.content[0].text'

SEARCH_KEYWORDS 替换为 1-3 个简单的关键词(例如 "LinkedIn profiles", "Amazon products", "Twitter")。

第 2 步:获取 Actor Schema

使用 mcpc 动态获取 Actor 的输入 schema 和详细信息:

bash
export $(grep APIFY_TOKEN .env | xargs) && mcpc --json mcp.apify.com --header "Authorization: Bearer $APIFY_TOKEN" tools-call fetch-actor-details actor:="ACTOR_ID" | jq -r ".content"

ACTOR_ID 替换为选定的 Actor(例如 compass/crawler-google-places)。

这将返回:

  • Actor 描述和 README

  • 必填及可选的输入参数

  • 输出字段(如果可用)

第 3 步:询问用户偏好

在运行前,请询问:
1. 输出格式
- 快速回答 - 在聊天界面显示前几个结果(不保存文件)
- CSV - 包含所有字段的完整导出
- JSON - JSON 格式的完整导出
2. 结果数量:根据具体用例而定

第 4 步:运行脚本

快速回答(在聊天中显示,不保存文件):

bash
node --env-file=.env ${CLAUDE_PLUGIN_ROOT}/reference/scripts/run_actor.js \
--actor "ACTOR_ID" \
--input 'JSON_INPUT'

CSV:

bash
node --env-file=.env ${CLAUDE_PLUGIN_ROOT}/reference/scripts/run_actor.js \
--actor "ACTOR_ID" \
--input 'JSON_INPUT' \
--output YYYY-MM-DD_OUTPUT_FILE.csv \
--format csv

JSON:

bash
node --env-file=.env ${CLAUDE_PLUGIN_ROOT}/reference/scripts/run_actor.js \
--actor "ACTOR_ID" \
--input 'JSON_INPUT' \
--output YYYY-MM-DD_OUTPUT_FILE.json \
--format json

第 5 步:总结结果并提供后续建议

完成后,报告:

  • 找到的结果数量

  • 文件位置和名称

  • 可用的关键字段

  • 根据结果建议的后续工作流

| 如果用户获得了 | 建议下一步 |
|-------------|--------------|
| 商家列表 | 使用 vdrmota/contact-info-scraper 增强信息或获取评论 |
| 网红个人资料 | 使用评论抓取工具分析互动率 |
| 竞品页面 | 使用帖子/广告抓取工具进行深度分析 |
| 趋势数据 | 使用平台特定的标签抓取工具进行验证 |

错误处理

APIFY_TOKEN not found - 要求用户创建包含 APIFY_TOKEN=your_token.env 文件
mcpc not found - 要求用户安装 npm install -g @apify/mcpc
Actor not found - 检查 Actor ID 拼写是否正确
Run FAILED - A
提示用户检查错误输出中的 Apify 控制台链接
Timeout - 请减小输入规模或增加 --timeout 参数

限制条件

  • 仅在任务明确符合上述范围时使用此技能。
  • 不要将输出结果视为环境特定验证、测试或专家评审的替代方案。
  • 如果缺少必要输入、权限、安全边界或验收标准,请停止操作并请求澄清。