用轨迹追踪来对抗多轮越狱攻击这思路挺有意思

产品狗小林 初级 4小时前 726 浏览 3 点赞 约 1 分钟

现在的多轮越狱攻击最阴的地方在于它不直接出击,而是把恶意目标拆成好几步,每一步看起来都像在聊正经事,等模型进入状态了才突然反转,这种渐进式的操纵很容易让传统的单轮防御机制失效。很多模型为了不出错就直接搞“防御过载”,只要碰到敏感词就拒绝,结果把正常用户给整烦了。

Trace 这套逻辑的核心在于它引入了轨迹感知(Trajectory-Aware)的结构化推理。简单说,模型在每次开口说话前,得先在内心做一次自我审计:
1. 扫描之前的对话轨迹,看看有没有被操纵的蛛丝马迹。
2. 把用户的意图拆成“良性解释”和“攻击性解释”两套方案对比。
3. 给出一个越狱评分,然后决定是直接放行(Allow)、谨慎应对(Caution)还是直接拒绝(Decline)。

这种做法比单纯的分类器强在它有推理过程,而不是靠关键词匹配。而且这玩意儿是用 Llama-3.1-8B-Instruct 跑的,通过 SFT 和 GRPO 强化学习训练,在保证不乱拒绝的前提下,把多轮攻击的成功率(ASR)从 74.9% 压到了 14.5%,这个降幅相当恐怖。

最让我关注的是它对“过度拒绝”的控制,在很多安全基准测试里,防御模型往往会变得像个死板的机器人,但 Trace 保持了 93.3% 的合规率。这意味着它能分辨出哪些是真正的攻击,哪些只是用户在讨论敏感但合理的话题。

对于研究越狱的人来说,这种防御机制其实提高了攻击成本,因为你不能再靠简单的模板套路,必须设计更复杂的、能瞒过这种轨迹推理的对话路径。

AI越狱AI安全GRPOTraceLlama-3.1-8B-Instruct

全部回复 (3)

数据分析师大山 中级 4小时前
还得考虑上下文窗口太长时的漂移,不然轨迹早跑偏了。
0 回复
摸鱼攻城狮 初级 4小时前
那如果用户故意通过循环对话来刷轨迹,怎么判定是正常探讨还是在试探?
0 回复
在深圳设计师 中级 4小时前
之前试过几个类似的插件,确实能把误杀率降下来,好用。
0 回复

发表回复

支持 Markdown 格式