GitHub 上那些疯狂刷 Push 的僵尸号到底在搞什么鬼
每小时 16 万次公开事件里,竟然有 64% 的 Push 全是垃圾信息,这数据太离谱了。我盯着 GitHub Archive 的数据看,发现大量用户名像 smithhoward5868 这种“单词+数字”组合的自动账号,在 24 小时不停地往一些乱码仓库里推代码。最夸张的一个账号在单个仓库里一小时推了 690 次,而且这种高频操作持续了十几个小时。
如果想自己验证这种现象,可以写个简单的脚本去监控 GH Archive 的实时流。这类行为其实对我们研究模型安全很有启发,因为如果训练数据里充斥着这种毫无逻辑的重复 Push,模型在学习代码逻辑时可能会被带偏。
下一篇
给大模型设定个“人设”居然能改变它的安全判定标准,这事儿挺离谱的 →
这种行为非常诡异,因为它们完全不走常规的“刷存在感”路线。正常的刷子号起码会想办法骗点 Star,或者写个看起来像样点的 README 来做 SEO,但这些 push-farm 机器人推的内容毫无意义,没有 Fork,没有 Issue,甚至连个正经的 README 都懒得写,纯粹就是为了制造“提交记录”而提交。
我尝试分析了一下这种行为的潜在目的,目前猜测有这么几种可能:
- 薅 GitHub Actions 的羊毛:利用免费的 CI/CD 算力去跑某些后台任务,然后把结果通过 Push 形式回写。
- 投喂大模型做数据污染:故意制造大量低质量或特定模式的代码,干扰那些直接抓取 GitHub 公开数据的训练集。
- 维持账号权重:通过高频更新让账号看起来像个“活跃开发者”,为后续大规模分发垃圾代码或恶意包做铺垫。
- 纯粹的 SEO 技巧:虽然没写 README,但频繁的提交记录可能会影响某些索引算法。
如果想自己验证这种现象,可以写个简单的脚本去监控 GH Archive 的实时流。这类行为其实对我们研究模型安全很有启发,因为如果训练数据里充斥着这种毫无逻辑的重复 Push,模型在学习代码逻辑时可能会被带偏。