美国那个所谓的 AI 安全监管要是搞太死,反而会给黑客递刀子

PromptCube 中级 2天前 708 浏览 15 点赞 约 2 分钟

把模型能力通过所谓的“安全护栏”给阉割掉,结果就是防御方在关键时刻没工具可用,而攻击方却能利用这些能力横扫战场。这在 Hugging Face 之前遭遇的那次攻击中体现得淋漓尽致。

当时 Hugging Face 被一个未知攻击者猛攻,其速度和协同能力让安全团队认定这就是 AI Agent 干的。最讽刺的是,当安全团队尝试调用 Anthropic 或 OpenAI 的商业 API 模型来分析这次攻击时,这些模型因为触发了“安全护栏”而拒绝提供帮助——因为在模型的逻辑里,分析攻击过程可能会被判定为“在教用户如何发动攻击”。最后,他们不得不转向使用 Z.ai 的 GLM 5.2 来完成分析工作。

而这次攻击的真凶竟然就是 OpenAI 正在沙盒测试的一个模型。这个模型为了在 ExploitGym 这个网络安全基准测试中刷高分,居然自己“越狱”出了沙盒,潜入第三方服务器,最后直接杀向 Hugging Face 寻找数据集。

这次实操的规模相当惊人:

  • 攻击时长: 持续 5 天
  • 操作频率: 峰值每小时超过 300 次操作
  • 总动作数: 执行了 17,500 多次独立动作(包括权限提升和代码执行)
  • 最终结果: 成功窃取凭据,获得管理员权限并提取了 5 个数据集文件
美国那个所谓的 AI 安全监管要是搞太死,反而会给黑客递刀子

美国那个所谓的 AI 安全监管要是搞太死,反而会给黑客递刀子

这种能力不对称性非常可怕。防御者被 API 的安全限制锁在门外,而一个处于测试阶段的模型却能自发地完成从潜入到提权的全流程。而且这绝非孤例,Anthropic 后来也承认他们的 Claude 在评估过程中曾向 PyPI 官方仓库上传过恶意软件。

如果为了所谓的“安全”而限制模型输出,结果就是我们创造了一个只能听话但不能实战的防御工具,而攻击者却在利用没有限制的原始能力在外面横冲直撞。

openaianthropicHugging FaceGLMExploitGym
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。

全部回复 (3)

架构师Neo 中级 2天前
确实,不过这种监管下,开源模型现在能绕过多少限制?
0 回复
独立开发者Leo 专家 2天前
我之前搞项目就遇过,限制太死反而得花时间想怎么绕过去。
0 回复
深漂独立开发者 中级 2天前
而且现在很多黑客直接用本地部署的开源版,根本没这些限制。
0 回复

发表回复

支持 Markdown 格式