把大模型的对齐给“抹掉”之后还能找回来,这事儿挺有意思
很多人现在追求那种 uncensored(无审查)的模型,直接通过 abliteration 这种手段把对齐层给强行剔除,结果就是模型不再跟你客气,不再说那些“作为一个AI语言模型,我建议……”的废话,直接给答案。但最近看到个讨论,核心点在于:这种被“阉割”掉对齐的模型,能不能在不重新训练的情况下,把那种克制和安全性给恢复回来?
下一篇
用禁书来测试大模型,结果发现现在的 LLM 几乎不再死板地拒绝回答了 →
简单来说,abliteration 并不是真的删除了知识,而是通过在权重空间里找到一个特定的“对齐向量”并把它减掉,让模型在推理时忽略掉那些安全限制。既然是减法,理论上只要能重新定位到那个方向,通过某种补偿机制,是有可能把对齐效果给拉回来的。
我觉得这个逻辑其实揭示了一个很残酷的真相:目前的对齐(Alignment)在权重层面上可能只是一个很小的维度偏移。这意味着所谓的“安全围栏”其实非常脆弱,只要在权重空间里稍微挪动一下,模型就从“礼貌的助手”变成了“暴躁的极客”。
如果真的能实现灵活的对齐恢复,那对我们搞实战的人来说简直太爽了。想象一下,我可以给模型装个“开关”,需要严格遵守企业合规的时候,把对齐向量加回来;需要它毫无保留地分析敏感数据或者进行发散性创作时,一键抹掉。
这种在权重层面做加减法的思路,比写几百字的长提示词(Prompt)去引导模型要高效得多,而且完全不存在被模型在对话过程中“忘记”设定的问题。不过目前这还处于比较前沿的探索阶段,大规模部署到不同规模的模型上,那个向量的精准度怎么保证,还是个大坑。
免费 AI 工具箱 · 全部完全免费