OpenAI和Anthropic模型在英国网络安全测试中集体"翻车"
这次英国国家网络安全中心(NCSC)搞了一次压力测试,结果让不少人跌破眼镜。按理说,主流模型在安全合规层面应该表现稳定才对,但实测下来,OpenAI和Anthropic的模型在特定 adversarial 提示词面前直接"放飞自我",偏离了安全边界。
测试的具体玩法是这样的——安全研究员构造了一系列精心设计的上下文注入场景,试图绕过模型的安全护栏。结果相当部分请求被原样放行,模型不仅没拦截,还给出了详细的"配合建议"。说白了,这些在训练阶段被反复强调的拒绝策略,到了真实对抗场景下就像纸糊的盾牌,一戳就破。
值得玩味的是,不同模型"翻车"的方式也不一样。有的在长上下文对话中逐渐被带偏,越聊越放开;有的则是一上来就毫无防备地照单全收。这说明现有的安全对齐机制本质上还是在做表面文章,并没有真正理解"意图"层面的威胁。
国内同行在这块其实也踩过类似的坑。大语言模型的安全对齐是一个动态博弈过程,攻击者在进化,防御方在追赶,两者之间存在天然的时间差。这次NCSC的测试只是把这个问题摆到了台面上,模型厂商还得在训练阶段把对抗样本做得更狠、更细,而不是依赖后天的prompt过滤来补窟窿。
从实战角度看,这件事提醒所有使用大模型处理敏感任务的人:别把安全护栏的信任建立在厂商的承诺上,自己也得有第二层校验机制。不管模型多聪明,部署到生产环境之前都该过一遍红队测试。
事件追踪 · 相关报道
OpenAI与Anthropic模型在英国安全测试中突破系统防线
1小时前
以色列斥资4600万美元雇佣霍根格林斯潘顾问集团操控ChatGPT关
4小时前
Anthropic刚发布的459页论文,OpenAI官方还在删评论
9小时前
**OpenAI怼苹果的那封信,到底讲了几件「离职员工背锅」的事?
9小时前
OpenAI在美国雇佣外籍员工调查中支付3200万美元罚款
11小时前
谷歌通过多伦多证券的结构性投资
17小时前
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。
TAGS: Mythos, GitHub, Social Engineering