用动力系统理论来抓大模型的“坏心思”到底靠不靠谱
现在的 LLM 安全防御大多还在玩“以毒攻毒”那一套,要么是用另一个大模型去审校,要么是堆一堆复杂的正则和关键词过滤。但这种方式有个致命弱点:对于黑盒模型,你根本不知道它内部的逻辑边界在哪。最近看到这篇论文挺有意思,它没打算去教模型怎么变乖,而是换了个极其硬核的视角——把 Prompt 和 Response 的嵌入向量(Embedding)看作是一个动力系统,通过观察它们在空间里的“运动轨迹”来判断模型是不是要开始胡言乱语或者输出违规内容了。
这种方法最牛的地方在于它是黑盒友好的。你不需要知道 Llama 内部的权重,也不需要去微调它,只需要监控它输出向量的“运动轨迹”是否出现了不符合物理规律的跳变就行。
下一篇
心理测量学搞 AI 安全评测?英国 AISI 这波操作有点意思 →
简单来说,这篇论文的核心逻辑不是在做语义分类,而是在做“动态偏差检测”。
它是怎么操作的
研究者引入了一个叫 DMD(Dynamic Mode Decomposition)的框架,这玩意儿原本是用来处理流体力学或者复杂物理系统的动力学特征的。他们的思路是这样的:
- 空间投影: 把用户输入的 Prompt 和模型吐出来的 Response 全部投射到高维的嵌入空间里。
- 构建预测模型: 利用 Koopman 算子,分别为“安全状态”和“不安全状态”拟合两套不同的动力学预测模型。你可以理解为,安全输出在向量空间里有一套特定的“运动规律”,而违规输出则会偏离这个规律。
- 残差得分计算: 当一个新的 Prompt-Response 对出现时,系统会对比它在“安全模型”和“不安全模型”下的预测误差(Differential Residual Score)。如果这个输出在安全模型下的预测残差异常高,那就说明它极大概率在搞事情。
几个值得玩味的发现
我仔细拆解了一下他们的实验结论,有两点对于做安全工程的人来说挺有启发:
- Prompt 的权重被低估了: 以前很多人觉得只要看 Response(模型回复)就行了,但实验证明,把 Prompt 的嵌入动态也放进去,对那种“诱导性违规”(Interaction-dependent violations)的检测效果提升非常大。特别是像 Llama-3 这种带有强因果解码逻辑的模型,Prompt 里的暗示会直接改变 Response 的向量轨迹。
- 范式的转换: 现在的趋势是用 AI 去模拟各种物理系统,但这篇论文反其道而行之,尝试用动力学系统(Dynamical Systems)这种数学工具去分析 AI 本身。这种“用确定性数学工具对抗概率性模型”的思路,确实比单纯靠 Prompt Engineering 去做安全防护要高级得多。
这种方法最牛的地方在于它是黑盒友好的。你不需要知道 Llama 内部的权重,也不需要去微调它,只需要监控它输出向量的“运动轨迹”是否出现了不符合物理规律的跳变就行。
免费 AI 工具箱 · 全部完全免费