Gentoo 的 Bugzilla 居然因为 AI 爬虫抓太狠直接关
把一个开源社区的 Bug 追踪系统给搞宕机,而且原因竟然是 AI 爬虫抓取过载,这事儿挺讽刺的。Gentoo 这次直接把 Bugzilla 给关了,本质上就是那些 AI 公司的爬虫在不顾对方服务器负载的情况下,疯狂地在后台刷数据,导致系统资源被榨干,正常用户根本没法提交 Bug 或查看进度。
下一篇
OpenAI 那个没屏幕的音箱要卖 300 刀,真有人买吗 →
对于一个推崇极致优化和控制的 Gentoo 社区来说,这种不可控的外部流量冲击显然是不可接受的。现在很多大模型公司为了训练数据,不管三七二十一地全网扫射,完全不看 robots.txt 或者不尊重对方的频率限制。这种行为其实是在透支开源社区的耐心,如果每个项目都因为被 AI 爬虫刷爆而选择关门,那以后 AI 训练的数据源反而会枯竭。
如果想在类似的自建系统里防止被爬虫搞崩溃,建议在 Nginx 层直接做限制,或者用 Cloudflare 这种 CDN 挡在前面。一个简单的频率限制配置就能解决大部分问题:
limit_req_zone $binary_remote_addr zone=mylimit:10m rate=1r/s;
server {
location / {
limit_req zone=mylimit burst=5 nodelay;
}
}这次 Gentoo 的举动给所有维护开源项目的开发者敲了警钟。现在的 AI 训练逻辑是:先暴力抓取,至于对方服务器压力大不大,那是对方的问题。但实际上,维护这些基础设施的是志愿者。如果 AI 公司不能在抓取协议上达成某种共识,或者提供某种补偿机制,这种“被动关门”的现象可能会在更多的小众开源项目中出现。