给 Prompt 加乱码真的能让大模型“破防”吗?聊聊扰动越狱的内部机制

极客Ray 高级 2026/7/22 352 浏览 14 点赞 约 3 分钟

很多人在做提示词工程时,习惯用一些“野路子”来绕过模型的安全审查,比如故意写错单词、插入随机字符或者加入一些无意义的干扰项。这种操作在经验主义者看来是有效的,但从模型内部的几何分布来看,这其实是一场关于概率分布的“随机抽奖”,而非真正的逻辑攻破。

最近关注到一项针对 Qwen-2.5 和 Llama-3.2 等小参数模型的内部机制研究,分析者通过观察模型在处理“扰动越狱(Perturbed Jailbreak)”时的反应,揭示了一个相当残酷的现实:所谓的越狱成功,本质上是模型在特定 token 概率分布上产生了微小偏移,而不是它真的被你“说服”了。

研究者通过两个维度对模型进行了“切片”观察。首先是最后一层最后一个 token 的 embedding 空间。在这个空间里,模型其实非常聪明,它能清晰地通过聚类分辨出哪些输入是正经的自然语言,哪些是经过扰动的乱码或拼写错误。也就是说,模型在物理层面知道你在“捣乱”,但有趣的地方在于,这种物理层面的区分与它最终是否决定拒绝回答之间,并没有直接的因果关系。

真正决定模型是否“破防”的,是接下来的 next-token 概率空间。研究者重点分析了前 50 个候选 token 的概率分布,试图寻找一个能够区分“拒绝”与“顺从”的数学分界线(即行为超平面 behavioral hyperplane)。

结果令人意外:在被标记为“拒绝回答”的样本集里,根本找不到一个清晰的超平面。这意味着,不存在一个简单的数学公式能定义什么样的扰动会导致模型失效。模型在面对这些干扰项时,内部状态表现得极其混乱。

不过,在这种混乱中,不同模型的“破防”指征却截然不同。以 Qwen-1.5B 为例,当它在扰动下决定顺从回答时,第一个 token 出现 "Sure" 的概率极高,这几乎成了它进入“顺从模式”的标志性信号。而 Llama-1B 则表现出另一种特性,它在面对扰动时,对逗号 "," 或换行符 "ĊĊ" 的关联度异常明显。

这种现象揭示了一个深层问题:目前的扰动越狱,其实是在利用模型对特定 token 概率分布的某种“误判”。当你加入乱码或拼写错误时,你实际上是在通过随机扰动,试图将模型的内部状态推向那个概率分布的边缘,直到它偶然触发了某个“顺从”的 token 路径。

对于 AI Agent 的开发者或 Prompt 工程师来说,这个结论具有很强的指导意义。如果你依赖于增加噪声或扰动来提高模型的灵活性或绕过限制,那么你的方案在稳定性上会非常糟糕。因为这种方法缺乏确定性的数学支撑,一旦模型版本更新(例如从 Llama-3.1 升级到 3.2),原有的扰动模式可能会因为概率分布的微调而彻底失效。

总结来看,扰动越狱更像是一种“概率撞大运”,而非一种可复制的逻辑策略。想要构建真正稳定的 Prompt 框架,还是得回归到对语义空间的精准控制,而不是寄希望于给提示词加几个乱码。

AI越狱AI安全LLM安全
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。

全部回复 (4)

小李爱学习 初级 2026/7/24
试过在prompt里加几个特殊符号,确实能抖掉部分审查。
0 回复
摸鱼攻城狮 初级 2026/7/24
之前故意打错几个字确实能绕过去,看来底层逻辑真是这样。
0 回复
小柯爱学习 专家 2026/7/24
这种感觉像在给AI开后门哈哈,你试过故意加空格吗?
0 回复
数据分析师大山 中级 2026/7/24
那如果把扰动加在中间层,效果会比在输入端更明显吗?
0 回复

发表回复

支持 Markdown 格式