用轨迹追踪来对抗多轮越狱攻击这思路挺有意思
现在的多轮越狱攻击最阴的地方在于它不直接出击,而是把恶意目标拆成好几步,每一步看起来都像在聊正经事,等模型进入状态了才突然反转,这种渐进式的操纵很容易让传统的单轮防御机制失效。很多模型为了不出错就直接搞“防御过载”,只要碰到敏感词就拒绝,结果把正常用户给整烦了。
下一篇
把大模型塞进机器人身体里,安全漏洞就不再只是屏幕上的乱码 →
Trace 这套逻辑的核心在于它引入了轨迹感知(Trajectory-Aware)的结构化推理。简单说,模型在每次开口说话前,得先在内心做一次自我审计:
1. 扫描之前的对话轨迹,看看有没有被操纵的蛛丝马迹。
2. 把用户的意图拆成“良性解释”和“攻击性解释”两套方案对比。
3. 给出一个越狱评分,然后决定是直接放行(Allow)、谨慎应对(Caution)还是直接拒绝(Decline)。
这种做法比单纯的分类器强在它有推理过程,而不是靠关键词匹配。而且这玩意儿是用 Llama-3.1-8B-Instruct 跑的,通过 SFT 和 GRPO 强化学习训练,在保证不乱拒绝的前提下,把多轮攻击的成功率(ASR)从 74.9% 压到了 14.5%,这个降幅相当恐怖。
最让我关注的是它对“过度拒绝”的控制,在很多安全基准测试里,防御模型往往会变得像个死板的机器人,但 Trace 保持了 93.3% 的合规率。这意味着它能分辨出哪些是真正的攻击,哪些只是用户在讨论敏感但合理的话题。
对于研究越狱的人来说,这种防御机制其实提高了攻击成本,因为你不能再靠简单的模板套路,必须设计更复杂的、能瞒过这种轨迹推理的对话路径。
免费 AI 工具箱 · 全部完全免费