让模型学会拒绝的是“恶意意图”还是单纯的“说话方式”?
说白了,模型在偷懒,它在通过识别表面特征(Surface-form)而不是理解深层意图来做判断。
下一篇
现在的 AI 安全测试逻辑其实陷入了一个怪圈,测试本身反而成了风险源 →
为了解决这个问题,最近有个叫 WIFA(Wrapper-Based Intent-Form Augmentation)的方案挺有意思,核心逻辑就是给模型做“对比实验”。它不再是简单地喂入有害样本,而是自动生成一组“结构相同但意图相反”的配对数据。比如,一个是有害意图的包装请求,另一个则是同样包装风格的良性请求。这样模型就没法通过识别“包装壳”来偷懒,必须得深挖意图才能决定是拒绝还是接受。
在具体的实操路径上,这套方法分成了两条线:
一、WIFA-Boost 路线
这是一个两阶段的微调配方。先通过 WIFA 构建的数据层进行增强,再进行高强度的安全对齐。在 Qwen 系列模型上的实测结果显示,这种方式在应对那些经过变形、伪装的有害指令时,拦截率明显更高。
二、A-GCRT 训练路线
这套方案更侧重于解决“过度拒绝”的问题。它通过正则化手段,强制要求模型对同一个意图的不同包装形式给出一致的判定分数,并且在有害组和良性组之间划定一个明确的边界(Margin)。
最让我关注的数据是,在使用 A-GCRT 之后,Qwen 在 OR-Bench 上的过度拒绝率从 25.7% 降低到了 17.4%。这意味着模型变得更“聪明”了,它能分清什么是真正的威胁,什么是用户只是说话风格比较古怪。
这种通过构建意图组来消除形式干扰的思路,比单纯堆砌安全数据集要高效得多。如果能把这套逻辑在大规模开源模型上跑通,我们可能终于能摆脱那种“稍微说话绕一点就触发安全警告”的死板体验。
免费 AI 工具箱 · 全部完全免费
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。