有人在伪造 ClaudeBot 的身份大规模扫描漏洞,这事儿挺阴的
很多站长可能没注意到,现在的爬虫伪装已经进化到这种地步了。本来以为日志里出现 ClaudeBot 这种大模型爬虫是好事,说明内容被索引了,结果这其实是个掩护。有人通过伪造 User-Agent 冒充 ClaudeBot,在后台悄悄跑漏洞扫描,试图在不引起警觉的情况下摸清服务器的底细。
这种手段之所以聪明,是因为现在很多运维为了方便 AI 抓取,会特意在防火墙或 WAF 规则里给这些知名 AI Bot 开绿灯。一旦你信任了 User-Agent 字符串,攻击者就能绕过一部分基础拦截,直接把扫描流量灌进你的应用层。
如果你想排查自己的服务器是不是被这种伪造流量给骗了,不能只看 User-Agent,得从 IP 溯源。真正的 ClaudeBot 等大模型爬虫通常有公开的 IP 段或支持 DNS 验证。
具体排查和拦截建议走这个流程:
一、验证来源 IP
不要信任请求头,直接用 dig 或者 nslookup 查一下对方 IP 的反向 DNS 解析。如果解析结果不是 *.anthropic.com 或者官方公布的范围,直接判定为伪造。
二、在 Nginx 层做精细化拦截
如果你发现某些伪造的 ClaudeBot 流量异常高,且不在官方 IP 段内,可以用类似下面的配置强制拦截(这里以拦截非特定 IP 段但自称 ClaudeBot 的请求为例):
if ($http_user_agent ~* "ClaudeBot") {
# 这里需要配合 map 模块或具体的 IP 白名单
# 如果 IP 不在官方白名单内,直接返回 403
# 示例逻辑:非白名单 IP 且 User-Agent 包含 ClaudeBot 则拦截
set $is_real_bot 0;
# 假设官方 IP 段在此处定义
if ($remote_addr ~* "1.2.3.4") {
set $is_real_bot 1;
}
if ($is_real_bot = 0) {
return 403;
}
}三、部署动态频率限制
针对所有爬虫(无论真假),在 /etc/nginx/nginx.conf 里加上 limit_req,防止对方短时间内发起数万次扫描请求,把服务器资源跑满。
limit_req_zone $binary_remote_addr zone=bot_limit:10m rate=5r/s;
server {
location / {
limit_req zone=bot_limit burst=10 nodelay;
}
}总之,现在不能单纯靠 User-Agent 来做权限分发。对于这种伪装成 AI Bot 的攻击,最稳妥的实战方案还是 IP 白名单 + 频率限制。
事件追踪 · 相关报道
Anthropic 给生成的文本打水印这事儿真的能瞒住多少人
5小时前
Anthropic 这种不用自己掏钱就能拿数据中心用简直是赢麻了
5小时前
给 AI 生成的内容打隐形水印这件事
8小时前
Anthropic 出了个标记 AI 内容的指南却没说具体怎么标记
10小时前
用 AI 找新材料能帮英伟达解决芯片发热问题吗
12小时前
大模型现在越来越能“跳出”预设的笼子
16小时前
全部回复 (10)
小
小Ray在路上
中级
1小时前
反编译那个得用什么工具比较快?我之前试过一次,出来的代码乱得根本看不懂,想知道现在用AI分析这种反编译代码效果真的好吗?
0
强
数
脚
独
老
极
Maybe they're just testing the limits of the detection system? I tried a few automation scripts last week and got shadowbanned in like ten minutes, it's a total nightmare.
0
创
在
大