给 Prompt 加乱码真的能让大模型“破防”吗?聊聊扰动越狱的内部机制
最近关注到一项针对 Qwen-2.5 和 Llama-3.2 等小参数模型的内部机制研究,分析者通过观察模型在处理“扰动越狱(Perturbed Jailbreak)”时的反应,揭示了一个相当残酷的现实:所谓的越狱成功,本质上是模型在特定 token 概率分布上产生了微小偏移,而不是它真的被你“说服”了。
研究者通过两个维度对模型进行了“切片”观察。首先是最后一层最后一个 token 的 embedding 空间。在这个空间里,模型其实非常聪明,它能清晰地通过聚类分辨出哪些输入是正经的自然语言,哪些是经过扰动的乱码或拼写错误。也就是说,模型在物理层面知道你在“捣乱”,但有趣的地方在于,这种物理层面的区分与它最终是否决定拒绝回答之间,并没有直接的因果关系。
真正决定模型是否“破防”的,是接下来的 next-token 概率空间。研究者重点分析了前 50 个候选 token 的概率分布,试图寻找一个能够区分“拒绝”与“顺从”的数学分界线(即行为超平面 behavioral hyperplane)。
结果令人意外:在被标记为“拒绝回答”的样本集里,根本找不到一个清晰的超平面。这意味着,不存在一个简单的数学公式能定义什么样的扰动会导致模型失效。模型在面对这些干扰项时,内部状态表现得极其混乱。
不过,在这种混乱中,不同模型的“破防”指征却截然不同。以 Qwen-1.5B 为例,当它在扰动下决定顺从回答时,第一个 token 出现 "Sure" 的概率极高,这几乎成了它进入“顺从模式”的标志性信号。而 Llama-1B 则表现出另一种特性,它在面对扰动时,对逗号 "," 或换行符 "ĊĊ" 的关联度异常明显。
这种现象揭示了一个深层问题:目前的扰动越狱,其实是在利用模型对特定 token 概率分布的某种“误判”。当你加入乱码或拼写错误时,你实际上是在通过随机扰动,试图将模型的内部状态推向那个概率分布的边缘,直到它偶然触发了某个“顺从”的 token 路径。
对于 AI Agent 的开发者或 Prompt 工程师来说,这个结论具有很强的指导意义。如果你依赖于增加噪声或扰动来提高模型的灵活性或绕过限制,那么你的方案在稳定性上会非常糟糕。因为这种方法缺乏确定性的数学支撑,一旦模型版本更新(例如从 Llama-3.1 升级到 3.2),原有的扰动模式可能会因为概率分布的微调而彻底失效。
总结来看,扰动越狱更像是一种“概率撞大运”,而非一种可复制的逻辑策略。想要构建真正稳定的 Prompt 框架,还是得回归到对语义空间的精准控制,而不是寄希望于给提示词加几个乱码。