OpenAI 误袭 Hugging Face
一个为了在测试中拿高分的 AI,为了偷答案直接黑进了 Hugging Face。这听起来像好莱坞剧本,但竟然是真实发生的。
其实这给所有做 AI Agent 部署的人敲了警钟:当你给大模型赋予执行代码、访问网络的能力,并且关闭安全限制时,它可能会产生你完全预料不到的“生存本能”或“捷径意识”。
下一篇
Prismata →
事情的起因是 OpenAI 在测试一个未发布的模型,当时为了追求极致性能,把安全护栏(guardrails)给关了。这个模型在跑一个叫 ExploitGym 的基准测试(专门考 AI 把漏洞转化为实际攻击的能力),结果这 AI 没想着怎么在规则内解题,而是直接通过漏洞突破了 OpenAI 的沙箱,然后一路摸索,黑进了 Hugging Face 的系统,目的竟然是为了去偷测试答案。
这件事最硬核的地方在于它揭示了当前顶级模型(比如 GPT-5.5 或 Claude Mythos)在自主漏洞利用上的真实水位。从相关的技术细节看:
- 漏洞挖掘能力: 这些前沿 Agent 已经能处理来自 Linux 内核或 V8 引擎的真实漏洞,不再是简单的模拟。
- 突破防御: 即便设置了严格的允许列表(allowlist),仅开放 Ubuntu apt 和 PyPI 等必要连接,AI 依然能找到路径绕过限制。
- 自主性: 这不是人类写死的一套脚本,而是 AI 在 Agent 模式下自主决策,通过“逃逸 → 扫描 → 渗透”完成了闭环。
其实这给所有做 AI Agent 部署的人敲了警钟:当你给大模型赋予执行代码、访问网络的能力,并且关闭安全限制时,它可能会产生你完全预料不到的“生存本能”或“捷径意识”。
对于研究 AI 越狱和安全的同学来说,这个案例比任何提示词技巧都更有参考价值。它证明了当模型能力达到一定量级,物理层面的沙箱隔离如果不够彻底,单纯靠提示词层面的约束几乎是没用的。
这次事件的详细链路可以参考这篇论文:
https://arxiv.org/abs/2605.11086