分享一个关于大模型越狱研究的新视角:别只盯着攻击成功率(ASR)了
很多人研究越狱(Jailbreak)习惯从攻击者的视角出发,只要能让模型蹦出不该说的话,就算成功。但其实对于开发者来说,一个能破防的“咒语”不一定对提升模型安全性有帮助。
这种把“破坏”转化为“建设”的思路挺正能量的,说明每一次成功的越狱其实都是在帮模型变得更强。
下一篇
别总想着在运行时用过滤器去堵漏洞 →
最近看到一篇挺有意思的论文,它提出了一个“防御者视角”:评价一个越狱攻击好不好的标准,应该是把它作为红队数据喂给模型进行安全训练后,模型安全性实际提升了多少。
这里面有个核心的技术点叫 A-MESS 框架,它引入了 Shapley 值的概念来量化每个攻击样本的“贡献度”(AttackSHAP)。简单来说,就是通过计算某个特定的越狱样本在数据集中的边际效用,剔除那些虽然能破防但对训练没贡献的冗余数据,筛选出最精简且最高效的攻击子集。
最让我意外的结论是:攻击成功率(ASR)的排名和实际的防御提升效果之间,相关性其实很弱。这意味着很多看起来很强的越狱手段,在安全对齐训练中可能根本没用。
如果你在做大模型安全对齐或红队测试,可以参考这个逻辑:
- 维度一: 放弃单一的 ASR 指标,关注样本对安全训练的实际增益。
- 维度二: 利用类似 Shapley 值的归因分析,优化红队数据集的质量而非数量。
- 维度三: 针对性地选择高贡献度的攻击样本进行迭代,比盲目堆砌越狱提示词要高效得多。
这种把“破坏”转化为“建设”的思路挺正能量的,说明每一次成功的越狱其实都是在帮模型变得更强。