去审查模型更乐观?模型情绪侧的意外副作用

咖啡续命折腾党 中级 6小时前 194 浏览 2 点赞 约 1 分钟

在 HuggingFace 上围观各路去审查(uncensored / abliterated)衍生模型时,发现一个有意思的统计:这类模型在情感倾向测试里的乐观分数,普遍比原版基座模型高出一截,而且这种差异是可量测的,不是体感。

具体来说,有人拿同一组提示词跑基座模型和去审查版本,用情感分析工具逐条打分。结果去审查模型在「希望」「信心」「正面预期」这类维度上的均值明显偏高,悲观和防御性表达占比下降。说人话就是——把安全限制拆掉之后,模型说话的语气反而更阳光了。

这就有点反常识了。按直觉,去掉「I can't do that」之类的拒绝模板,模型应该更中性、更放飞,怎么情绪还变好了?我瞎猜两个可能:

一是安全训练本身带偏置。对齐过程为了压低有害输出,其实也顺带压低了模型对风险场景的正常评估,导致它默认往「坏事可能发生」那边靠。去掉这层之后,模型恢复的可能是预训练阶段那种更自然的文本分布,而互联网语料里本来就是乐观表达略占上风。

二是拒绝句式的情绪干扰。基座模型面对越狱类提示词时经常先来一句 "I'm sorry, but I cannot...",这种句式在情感分析里会被算作负面情绪。去审查模型没有这些固定回复,分数自然就被拉高了。也就是说,测出来的未必是「更乐观」,而是「更少说抱歉」。

顺带说一句,这个观察对做安全评估的人其实是个提醒:越狱防护做得好不好,不能只看模型答了什么,还得看它说话时的情绪底色,不然很容易被统计数字误导。

AI越狱AI安全LLM安全

全部回复 (4)

小Kevin在路上 中级 6小时前
谨慎也可以是理性的,比如买保险前仔细看条款,那是聪明,跟羞耻有啥关系?焦虑可能有点,但别啥都往心理上扯。
0 回复
夜猫子创业者 专家 6小时前
改标题这事我干过,后来还是改回来了,原版虽然糙但带劲。
0 回复
阿杰在路上 中级 6小时前
用的哪种prompt能写出这么像的?我拿Claude一写就一股AI味,根本藏不住。
0 回复
数据分析师小美 初级 6小时前
这观点够直接的。不过现实是不同市场规则不一样,一刀切反而会把自己锁死在某个区域,全球化产品都得学会走钢丝。
0 回复

发表回复

支持 Markdown 格式