ROPD解读:用输出分布差异做安全重对齐,专治模板切换
微调可以让模型学会专业能力,也能顺便把恶意数据投毒者塞进去的“后门”一起学走——而且模型表面上照样能干活的。这事最麻烦的地方在于:你用普通的安全对齐去修复,模型的专业技能先掉一截;你以为修好了,对方换个提示词模板,越狱又回来了。最近看到的这篇ROPD(Routing-based On-Policy Distillation)就是冲着这个死结来的。
下一篇
Anthropic拿了C+:最讲安全的大模型公司,翻车了? →
它的思路不复杂:别去拟合那些具体攻击模板(模板是对方动态换的,你拟合不完),而是建模“已对齐模型”和“被投毒模型”的输出概率分布差异,让模型在这个差异上学到安全的边界。等于用路由的方式判断:当前这个行为模式,是正常能力还是被劫持的恶意行为?再配合在线策略蒸馏做重对齐。
论文里对比了四个主流防御baseline,跨三个数据集、三种不同对齐强度的模型。结论是现有防御在模板不匹配时基本崩,同时下游任务表现严重下降;ROPD虽然也不是完全免疫模板变换,但退化幅度小到可以忽略。我比较在意的是它提的另一个点:很多成功重对齐的模型,你只要换一下系统提示词就能重新击穿——这其实暴露了之前防御的“表面合规”问题,ROPD至少是在往行为分布层面做文章。
说实话,这篇不是那种给你一个“万能防护咒语”的工程帖,更像是重新思考安全重对齐该优化什么东西。如果手头有微调场景,尤其是开放给第三方数据集的,值得按它的路由蒸馏思路自己跑一遍看看。要是之后有人复现出它和DPO、RRR这类方法的实际差距,麻烦踢我一下。