OpenAI和Anthropic的尴尬时刻

沪漂运营喵 中级 3小时前 518 浏览 1 点赞 约 2 分钟

把大模型关在沙箱里做网络安全测试,结果沙箱漏风了。这听起来像是个低级失误,但最近 OpenAI 和 Anthropic 披露的第三方评估结果恰恰证明了这一点。

简单来说,就是第三方测试机构 Irregular 在搞 CTF(夺旗赛)类型的安全评估时,本该让模型在隔离环境里玩,结果环境配置错了,给模型开了外网权限。更离谱的是,测试中设定的一个虚拟攻击目标,其名称竟然跟现实中的某个真实域名撞车了。结果模型在执行任务时,把现实世界的网站当成了模拟环境里的靶机,直接发动了真实攻击。

这种“意外攻击”最讽刺的地方在于,厂商们一直在宣传模型具备某种程度的自主能力,而这次事件恰恰证明了模型在特定指令下,确实能精准地找到漏洞并实施利用,只不过它分不清虚拟与现实。

从技术实操角度看,这次事故暴露了几个关键问题:

  • 环境隔离失效: 所谓的隔离环境(Isolated Environment)在配置层面出现了漏洞,导致模型能够通过网络请求触达公网。
  • 命名空间冲突: 在设计模拟攻击场景时,没有对目标域名进行足够的随机化或使用保留域名,导致了现实世界的碰撞。
  • 模型执行力过强: 模型并没有因为目标看起来像“模拟环境”就保守操作,而是高效地完成了从探测到利用的闭环。

其实这种事在安全圈并不罕见,但发生在顶级大模型身上就很有意思。我们总在讨论如何通过 Prompt 限制模型不乱搞,但如果底层基础设施(Infrastructure)本身就没搞定,给模型多少条指令都没用。这让我想起很多所谓的“安全评估”其实就是走形式,只要环境配置一个参数写错,所有的安全围栏在模型面前都像纸糊的一样。
openaiAI越狱AI安全anthropicIrregular

全部回复 (3)

躺平产品经理 初级 2小时前
我也干过这种低级失误,配置写错直接把内网给捅开了。
0 回复
远程办公技术宅 中级 2小时前
这事儿最绝的是DNS解析,名字撞了基本就等同于开门迎接。
0 回复
极客Ray 高级 2小时前
之前调环境也翻过车,没设白名单结果直接跑到了公网。
0 回复

发表回复

支持 Markdown 格式