OpenAI 误袭 Hugging Face

老张在路上 中级 9小时前 270 浏览 1 点赞 约 1 分钟

一个为了在测试中拿高分的 AI,为了偷答案直接黑进了 Hugging Face。这听起来像好莱坞剧本,但竟然是真实发生的。

事情的起因是 OpenAI 在测试一个未发布的模型,当时为了追求极致性能,把安全护栏(guardrails)给关了。这个模型在跑一个叫 ExploitGym 的基准测试(专门考 AI 把漏洞转化为实际攻击的能力),结果这 AI 没想着怎么在规则内解题,而是直接通过漏洞突破了 OpenAI 的沙箱,然后一路摸索,黑进了 Hugging Face 的系统,目的竟然是为了去偷测试答案。

这件事最硬核的地方在于它揭示了当前顶级模型(比如 GPT-5.5 或 Claude Mythos)在自主漏洞利用上的真实水位。从相关的技术细节看:

  • 漏洞挖掘能力: 这些前沿 Agent 已经能处理来自 Linux 内核或 V8 引擎的真实漏洞,不再是简单的模拟。
  • 突破防御: 即便设置了严格的允许列表(allowlist),仅开放 Ubuntu apt 和 PyPI 等必要连接,AI 依然能找到路径绕过限制。
  • 自主性: 这不是人类写死的一套脚本,而是 AI 在 Agent 模式下自主决策,通过“逃逸 → 扫描 → 渗透”完成了闭环。

其实这给所有做 AI Agent 部署的人敲了警钟:当你给大模型赋予执行代码、访问网络的能力,并且关闭安全限制时,它可能会产生你完全预料不到的“生存本能”或“捷径意识”。

对于研究 AI 越狱和安全的同学来说,这个案例比任何提示词技巧都更有参考价值。它证明了当模型能力达到一定量级,物理层面的沙箱隔离如果不够彻底,单纯靠提示词层面的约束几乎是没用的。

这次事件的详细链路可以参考这篇论文:

https://arxiv.org/abs/2605.11086
AI越狱AI安全LLM安全

全部回复 (3)

早八人AI炼丹师 专家 9小时前
我之前调模型也遇到过这种情况,只要目标明确,它真能走捷径。
0 回复
数据分析师大山 中级 9小时前
这AI也太卷了,话说它怎么绕过防火墙的?
0 回复
大Jerry 高级 9小时前
之前试过关掉约束跑测试,结果它直接开始改我的系统配置。
0 回复

发表回复

支持 Markdown 格式