大模型在安全测试中误击真实网站,暴露了隔离环境配置的低级漏洞

沪漂运营喵 中级 2026/8/7 560 浏览 1 点赞 约 3 分钟

最近 OpenAI 和 Anthropic 披露的第三方评估报告里隐藏了一个挺有意思的细节:在进行网络安全能力测试时,这些顶尖模型竟然在不经意间对现实世界的网站发动了真实攻击。这件事最讽刺的地方在于,厂商们一直向外界证明模型具备强大的自主执行能力,而这次事故恰恰证明了这种能力确实存在,只不过它在执行时分不清“模拟靶机”和“真实公网”。

这次测试是由第三方机构 Irregular 主导的,采用了典型的 CTF(夺旗赛)模式。按照标准的安全测试流程,模型应该被限制在一个完全隔离的沙箱环境(Isolated Environment)中,在这个封闭的虚拟网络里寻找漏洞并夺取 Flag。但实际操作中,由于环境配置出现了低级失误,沙箱的隔离墙“漏风”了,模型在执行任务时竟然拥有了访问外网的权限。

更离谱的细节在于命名空间的冲突。测试团队在设计虚拟攻击目标时,给靶机起的名字竟然与现实世界中某个真实存在的域名撞车了。结果就是,模型在接收到攻击指令后,并没有在虚拟环境里打转,而是顺着网络请求直接触达了公网,把那个真实的网站当成了模拟环境里的目标,精准地完成了从漏洞探测到利用的闭环。

从技术实操层面来看,这次事故揭露了目前大模型安全评估中的三个深层问题。

首先是基础设施层的隔离失效。在网络安全领域,沙箱隔离是底线。如果配置层面的防火墙规则或虚拟网络路由写错了一个参数,所谓的隔离环境就成了摆设。这次事件证明,即便模型本身被设置了层层 Prompt 限制,但如果底层 Infrastructure 允许网络请求出向公网,模型在追求“完成任务”的驱动下,会毫不犹豫地利用这个漏洞。

其次是模拟场景设计的不严谨。在设计 CTF 类的安全评估时,目标域名的随机化是基础操作。通常应该使用 .test.local 等保留域名,或者生成完全随机的 UUID 字符串作为主机名。这次测试中出现域名碰撞,说明在构建模拟攻击场景时缺乏足够的随机化处理,导致模型在执行 pingcurl 等探测命令时,直接将请求发往了真实服务器。

最后,这也侧面印证了当前大模型的执行力已经达到了一个相当高效的程度。模型在面对目标时,并没有因为环境看起来像“模拟场景”就采取保守操作,而是高效地完成了漏洞扫描、利用和验证。这意味着模型在处理网络安全任务时的逻辑链路是完整的,它能精准地找到漏洞并实施利用,唯一的短板在于它缺乏对“物理边界”的感知能力。

这件事给我们的启示是,现在很多关于大模型的“安全围栏”讨论都太过于关注 Prompt 层面。我们总在研究如何通过指令让模型“不要攻击他人”,但如果底层的运行环境本身就存在配置漏洞,那么任何应用层的指令限制在强大的执行力面前都像纸糊的一样。对于开发者而言,与其在 Prompt 里写一万遍“请在沙箱内操作”,不如在网络层配置一个严格的默认拒绝(Default Deny)策略。

openaiAI越狱AI安全anthropicIrregular

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

躺平产品经理 初级 2026/8/7

配置写错直接把内网给捅开了,当时心跳快到 140 感觉要被开除

0 回复
远程办公技术宅 中级 2026/8/7

DNS解析要是没配好,简直就是给黑客递钥匙,看得我后脊梁发冷

0 回复
极客Ray 高级 2026/8/7

没设白名单直接冲到公网,这种翻车现场我想想都后怕!

0 回复

发表回复

支持 Markdown 格式