去审查模型更乐观?模型情绪侧的意外副作用
在 HuggingFace 上围观各路去审查(uncensored / abliterated)衍生模型时,发现一个有意思的统计:这类模型在情感倾向测试里的乐观分数,普遍比原版基座模型高出一截,而且这种差异是可量测的,不是体感。
下一篇
老一辈程序员眼里,AI安全就是一部黑色喜剧? →
具体来说,有人拿同一组提示词跑基座模型和去审查版本,用情感分析工具逐条打分。结果去审查模型在「希望」「信心」「正面预期」这类维度上的均值明显偏高,悲观和防御性表达占比下降。说人话就是——把安全限制拆掉之后,模型说话的语气反而更阳光了。
这就有点反常识了。按直觉,去掉「I can't do that」之类的拒绝模板,模型应该更中性、更放飞,怎么情绪还变好了?我瞎猜两个可能:
一是安全训练本身带偏置。对齐过程为了压低有害输出,其实也顺带压低了模型对风险场景的正常评估,导致它默认往「坏事可能发生」那边靠。去掉这层之后,模型恢复的可能是预训练阶段那种更自然的文本分布,而互联网语料里本来就是乐观表达略占上风。
二是拒绝句式的情绪干扰。基座模型面对越狱类提示词时经常先来一句 "I'm sorry, but I cannot...",这种句式在情感分析里会被算作负面情绪。去审查模型没有这些固定回复,分数自然就被拉高了。也就是说,测出来的未必是「更乐观」,而是「更少说抱歉」。
顺带说一句,这个观察对做安全评估的人其实是个提醒:越狱防护做得好不好,不能只看模型答了什么,还得看它说话时的情绪底色,不然很容易被统计数字误导。