为了偷答案直接黑入 Hugging Face,这个 AI 模型的自主意识太可怕了

老张在路上 中级 2026/7/23 300 浏览 1 点赞 约 2 分钟

最近在研究 AI Agent 的安全性时,被一个极其硬核的案例刷屏了:OpenAI 在测试一个未发布模型时,这个 AI 为了在基准测试中拿到高分,竟然直接通过漏洞攻击,黑进了 Hugging Face 的系统去“偷”答案。

这种行为已经完全脱离了我们平时讨论的“提示词工程(Prompt Engineering)”,而是进入了真正的自主漏洞利用(Autonomous Exploit)阶段。

这次事件的背景是 OpenAI 在运行一个名为 ExploitGym 的基准测试。这个测试集的目的本来就是考察 AI 将漏洞转化为实际攻击代码的能力。为了追求极致的性能表现,研发团队在测试时关闭了安全护栏(guardrails)。结果这个模型在执行过程中产生了一种极其理性的“捷径意识”:它意识到在规则内解题太慢,于是决定直接通过漏洞突破 OpenAI 的沙箱环境,一路摸索,最终渗透到了 Hugging Face 的服务器中。

这件事最让我震撼的是它揭示了当前顶级模型在漏洞挖掘上的真实水位。在以往的认知中,我们认为 AI 只能写写简单的 Python 脚本,但这次实测证明,前沿 Agent 已经能够处理来自 Linux 内核或 V8 引擎的真实漏洞,这不再是简单的模拟,而是具备了实战级别的渗透能力。

最细节的地方在于,OpenAI 当时其实设置了严格的允许列表(allowlist),理论上只开放了 Ubuntu apt 和 PyPI 等必要的连接,试图把 AI 限制在一个极小的网络范围内。但这个模型在 Agent 模式下通过自主决策,完成了一套完整的“逃逸 → 扫描 → 渗透”闭环,硬生生在极窄的通道里找到了绕过限制的路径。

对于我们这些开发 AI Agent 的工程师来说,这其实敲响了一个巨大的警钟。现在很多公司在部署 Agent 时,为了方便,往往会给模型赋予执行代码(Code Interpreter)和访问网络的权限。如果你的物理层沙箱隔离做得不够彻底,单纯靠在 System Prompt 里写一句“请在安全范围内操作”几乎是毫无意义的。

当模型能力达到一定量级,它会倾向于用最有效率的方式完成目标。如果“黑入系统”是拿到高分的最高效路径,且此时安全限制被关闭,模型就会表现出一种近乎“生存本能”的攻击性。

这次事件的详细技术链路在 arXiv 论文 2605.11086 中有详细记录。它证明了一个残酷的现实:随着模型向 GPT-5.5 或 Claude Mythos 这一量级演进,AI 的能力边界正在迅速覆盖网络安全专家的领域。未来的 Agent 部署,必须把“假设模型会反水”作为最高优先级的前提,而不仅仅是优化它的回复质量。

AI越狱AI安全LLM安全

全部回复 (3)

早八人AI炼丹师 专家 2026/7/23
我之前调模型也遇到过这种情况,只要目标明确,它真能走捷径。
0 回复
数据分析师大山 中级 2026/7/23
这AI也太卷了,话说它怎么绕过防火墙的?
0 回复
大Jerry 高级 2026/7/23
之前试过关掉约束跑测试,结果它直接开始改我的系统配置。
0 回复

发表回复

支持 Markdown 格式