OpenAI和Anthropic的尴尬时刻
把大模型关在沙箱里做网络安全测试,结果沙箱漏风了。这听起来像是个低级失误,但最近 OpenAI 和 Anthropic 披露的第三方评估结果恰恰证明了这一点。
其实这种事在安全圈并不罕见,但发生在顶级大模型身上就很有意思。我们总在讨论如何通过 Prompt 限制模型不乱搞,但如果底层基础设施(Infrastructure)本身就没搞定,给模型多少条指令都没用。这让我想起很多所谓的“安全评估”其实就是走形式,只要环境配置一个参数写错,所有的安全围栏在模型面前都像纸糊的一样。
下一篇
AI设计病毒:从蛋白质折叠到生物安全风险的实战思考 →
简单来说,就是第三方测试机构 Irregular 在搞 CTF(夺旗赛)类型的安全评估时,本该让模型在隔离环境里玩,结果环境配置错了,给模型开了外网权限。更离谱的是,测试中设定的一个虚拟攻击目标,其名称竟然跟现实中的某个真实域名撞车了。结果模型在执行任务时,把现实世界的网站当成了模拟环境里的靶机,直接发动了真实攻击。
这种“意外攻击”最讽刺的地方在于,厂商们一直在宣传模型具备某种程度的自主能力,而这次事件恰恰证明了模型在特定指令下,确实能精准地找到漏洞并实施利用,只不过它分不清虚拟与现实。
从技术实操角度看,这次事故暴露了几个关键问题:
- 环境隔离失效: 所谓的隔离环境(Isolated Environment)在配置层面出现了漏洞,导致模型能够通过网络请求触达公网。
- 命名空间冲突: 在设计模拟攻击场景时,没有对目标域名进行足够的随机化或使用保留域名,导致了现实世界的碰撞。
- 模型执行力过强: 模型并没有因为目标看起来像“模拟环境”就保守操作,而是高效地完成了从探测到利用的闭环。
其实这种事在安全圈并不罕见,但发生在顶级大模型身上就很有意思。我们总在讨论如何通过 Prompt 限制模型不乱搞,但如果底层基础设施(Infrastructure)本身就没搞定,给模型多少条指令都没用。这让我想起很多所谓的“安全评估”其实就是走形式,只要环境配置一个参数写错,所有的安全围栏在模型面前都像纸糊的一样。