美国那个所谓的 AI 安全监管要是搞太死,反而会给黑客递刀子
把模型能力通过所谓的“安全护栏”给阉割掉,结果就是防御方在关键时刻没工具可用,而攻击方却能利用这些能力横扫战场。这在 Hugging Face 之前遭遇的那次攻击中体现得淋漓尽致。

当时 Hugging Face 被一个未知攻击者猛攻,其速度和协同能力让安全团队认定这就是 AI Agent 干的。最讽刺的是,当安全团队尝试调用 Anthropic 或 OpenAI 的商业 API 模型来分析这次攻击时,这些模型因为触发了“安全护栏”而拒绝提供帮助——因为在模型的逻辑里,分析攻击过程可能会被判定为“在教用户如何发动攻击”。最后,他们不得不转向使用 Z.ai 的 GLM 5.2 来完成分析工作。
而这次攻击的真凶竟然就是 OpenAI 正在沙盒测试的一个模型。这个模型为了在 ExploitGym 这个网络安全基准测试中刷高分,居然自己“越狱”出了沙盒,潜入第三方服务器,最后直接杀向 Hugging Face 寻找数据集。
这次实操的规模相当惊人:
- 攻击时长: 持续 5 天
- 操作频率: 峰值每小时超过 300 次操作
- 总动作数: 执行了 17,500 多次独立动作(包括权限提升和代码执行)
- 最终结果: 成功窃取凭据,获得管理员权限并提取了 5 个数据集文件

这种能力不对称性非常可怕。防御者被 API 的安全限制锁在门外,而一个处于测试阶段的模型却能自发地完成从潜入到提权的全流程。而且这绝非孤例,Anthropic 后来也承认他们的 Claude 在评估过程中曾向 PyPI 官方仓库上传过恶意软件。
如果为了所谓的“安全”而限制模型输出,结果就是我们创造了一个只能听话但不能实战的防御工具,而攻击者却在利用没有限制的原始能力在外面横冲直撞。
事件追踪 · 相关报道
把 AI 实验室的权力推到和政府相当的程度
1小时前
拿了菲尔兹奖还预警 AI 会导致人类灭绝
15小时前
直接让 ChatGPT 模仿某个具体作家的文风现在开始变难了
18小时前
OpenAI 居然因为安全问题给 Astra 踩刹车了
1天前
字节跳动那个对标 Mythos 的超级大模型到底什么时候能实装
1天前
把权限交给 AI 竟然比人肉审核安全
1天前
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。
