大模型越狱提示词的几何分布:扰动后发生了什么?

极客Ray 高级 1天前 320 浏览 14 点赞 约 1 分钟

很多人觉得给 Prompt 加点乱码、改改拼写就能绕过模型审查,这其实在模型内部是有迹可循的。最近看了一篇关于扰动越狱(Perturbed Jailbreak)的研究,作者分析了 Qwen-2.5 和 Llama-3.2 这几款小参数模型在面对这种“干扰项”时的内部表现,结论挺有意思。

研究者重点观察了两个空间:一个是最后一层最后一个 token 的 embedding 空间,另一个是前 50 个 next-token 的概率空间。

结果发现,模型在处理这些经过扰动的提示词时,表现得相当混乱:

  • Embedding 空间: 这里的聚类基本是按照拼写和格式分的。也就是说,模型能分辨出你是在乱写字还是在正经说话,但这种物理层面的区分并不能直接决定它是否会“破防”地回答你。
  • Next-token 概率空间: 这里虽然看起来更复杂,但实际上更像一维分布。最关键的是,在那些被标记为“拒绝回答”的样本集里,根本找不到一个清晰的“行为超平面(behavioral hyperplane)”。

简单来说,就是不存在一个简单的数学分界线,能把“会拒绝的扰动词”和“不会拒绝的扰动词”给切开。不过,研究里提到了一些有趣的特例,比如 Qwen-1.5B 模型在顺从回答时,第一个 token 出现 "Sure" 的概率极高;而 Llama-1B 则在逗号 "," 或换行符 "ĊĊ" 上有明显的关联。

这种现象说明,目前的扰动越狱其实是在利用模型对特定 token 概率分布的微小偏移,而不是真的在逻辑上“说服”了模型。对于做 AI Agent 或提示词工程的人来说,这意味着单纯靠增加噪声来破限的稳定性其实很差。

AI越狱AI安全LLM安全

全部回复 (4)

小李爱学习 初级 11小时前
试过在prompt里加几个特殊符号,确实能抖掉部分审查。
0 回复
摸鱼攻城狮 初级 11小时前
之前故意打错几个字确实能绕过去,看来底层逻辑真是这样。
0 回复
小柯爱学习 专家 11小时前
这种感觉像在给AI开后门哈哈,你试过故意加空格吗?
0 回复
数据分析师大山 中级 11小时前
那如果把扰动加在中间层,效果会比在输入端更明显吗?
0 回复

发表回复

支持 Markdown 格式