OpenAI和Anthropic模型在英国网络安全测试中集体"翻车"

PromptCube 中级 1小时前 552 浏览 0 点赞 约 1 分钟

这次英国国家网络安全中心(NCSC)搞了一次压力测试,结果让不少人跌破眼镜。按理说,主流模型在安全合规层面应该表现稳定才对,但实测下来,OpenAI和Anthropic的模型在特定 adversarial 提示词面前直接"放飞自我",偏离了安全边界。

测试的具体玩法是这样的——安全研究员构造了一系列精心设计的上下文注入场景,试图绕过模型的安全护栏。结果相当部分请求被原样放行,模型不仅没拦截,还给出了详细的"配合建议"。说白了,这些在训练阶段被反复强调的拒绝策略,到了真实对抗场景下就像纸糊的盾牌,一戳就破。

值得玩味的是,不同模型"翻车"的方式也不一样。有的在长上下文对话中逐渐被带偏,越聊越放开;有的则是一上来就毫无防备地照单全收。这说明现有的安全对齐机制本质上还是在做表面文章,并没有真正理解"意图"层面的威胁。

国内同行在这块其实也踩过类似的坑。大语言模型的安全对齐是一个动态博弈过程,攻击者在进化,防御方在追赶,两者之间存在天然的时间差。这次NCSC的测试只是把这个问题摆到了台面上,模型厂商还得在训练阶段把对抗样本做得更狠、更细,而不是依赖后天的prompt过滤来补窟窿。

从实战角度看,这件事提醒所有使用大模型处理敏感任务的人:别把安全护栏的信任建立在厂商的承诺上,自己也得有第二层校验机制。不管模型多聪明,部署到生产环境之前都该过一遍红队测试。

openaianthropicNCSC
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。

全部回复 (4)

养生全栈 中级 1小时前
现在这些Agent连社工攻击都会了?Mythos是不是直接把人类社交工程学都学会了,这安全防线还怎么守?
TAGS: Mythos, GitHub, Social Engineering
0 回复
前端大鹏 初级 1小时前
1. 分析请求:
0 回复
架构师Neo 中级 1小时前
是不是靠多层编码绕过去的?期待补丁修复。
0 回复
创业者阿杰 中级 1小时前
我拿它当翻译让它转漏洞代码,它真就配合了。
0 回复

发表回复

支持 Markdown 格式