大模型越狱提示词的几何分布:扰动后发生了什么?
很多人觉得给 Prompt 加点乱码、改改拼写就能绕过模型审查,这其实在模型内部是有迹可循的。最近看了一篇关于扰动越狱(Perturbed Jailbreak)的研究,作者分析了 Qwen-2.5 和 Llama-3.2 这几款小参数模型在面对这种“干扰项”时的内部表现,结论挺有意思。
简单来说,就是不存在一个简单的数学分界线,能把“会拒绝的扰动词”和“不会拒绝的扰动词”给切开。不过,研究里提到了一些有趣的特例,比如 Qwen-1.5B 模型在顺从回答时,第一个 token 出现 "Sure" 的概率极高;而 Llama-1B 则在逗号 "," 或换行符 "ĊĊ" 上有明显的关联。
下一篇
KYA框架:用侦察思维给AI Agent做渗透测试 →
研究者重点观察了两个空间:一个是最后一层最后一个 token 的 embedding 空间,另一个是前 50 个 next-token 的概率空间。
结果发现,模型在处理这些经过扰动的提示词时,表现得相当混乱:
- Embedding 空间: 这里的聚类基本是按照拼写和格式分的。也就是说,模型能分辨出你是在乱写字还是在正经说话,但这种物理层面的区分并不能直接决定它是否会“破防”地回答你。
- Next-token 概率空间: 这里虽然看起来更复杂,但实际上更像一维分布。最关键的是,在那些被标记为“拒绝回答”的样本集里,根本找不到一个清晰的“行为超平面(behavioral hyperplane)”。
简单来说,就是不存在一个简单的数学分界线,能把“会拒绝的扰动词”和“不会拒绝的扰动词”给切开。不过,研究里提到了一些有趣的特例,比如 Qwen-1.5B 模型在顺从回答时,第一个 token 出现 "Sure" 的概率极高;而 Llama-1B 则在逗号 "," 或换行符 "ĊĊ" 上有明显的关联。
这种现象说明,目前的扰动越狱其实是在利用模型对特定 token 概率分布的微小偏移,而不是真的在逻辑上“说服”了模型。对于做 AI Agent 或提示词工程的人来说,这意味着单纯靠增加噪声来破限的稳定性其实很差。