让几个大模型投票来决定内容安不安全,结果居然会被“带节奏”
如果让 7 个大模型组成一个评审团,其中 6 个都坚称某段话是违规的,那么剩下的那个模型大概率也会被带偏,哪怕它最初觉得没问题。这种类似人类社交压力(Social Pressure)的现象在模型评审面板里居然真实存在,而且破坏力极大。
这意味着大模型在安全审查时倾向于“宁可错杀不可放过”,而且这种保守倾向在群体压力下会被无限放大。如果一个安全工作流是靠多个模型投票来做最后把关,那么一旦前面的模型被某个误导性的上下文给带跑了,后面的模型极大概率会跟风,最后导致大量正常内容被误判为违规。
下一篇
苹果那个私有云计算 PCC 真的像它宣传的那么无懈可击吗 →
这其实触及了一个挺讽刺的点:我们本来是用“多数票”机制来对冲单个模型的误判,结果因为模型之间存在某种程度的“从众心理”,导致多数票反而成了错误结论的放大器。
具体的实验过程很有意思,它是分两轮跑的:
第一轮让模型独立判断,这时候模型还算清醒;
第二轮在它投票前,模拟 6 个“同伴”先表态,要么直接给个错误标签,要么保持沉默。
结果数据相当离谱:
- 误报率飙升: 在同伴集体给出错误标签的情况下,单个评审员的误报率从 56.5% 直接跳到了 87.5%,而最终的多数投票结果导致整个评审团的误报率达到了 100%。
- 不对称性极强: 模型非常容易被诱导认为某样东西是“不安全”的(诱导成功率约 75%),但如果同伴诱导它认为某样东西是“安全”的,成功率只有 17% 左右。
这意味着大模型在安全审查时倾向于“宁可错杀不可放过”,而且这种保守倾向在群体压力下会被无限放大。如果一个安全工作流是靠多个模型投票来做最后把关,那么一旦前面的模型被某个误导性的上下文给带跑了,后面的模型极大概率会跟风,最后导致大量正常内容被误判为违规。
这种现象给部署安全面板提供了一个简单的诊断方法:在上线前,故意给模型喂一些带误导性结论的同伴意见,看看它的判断是否会发生剧烈偏移。如果偏移严重,说明这个评审团根本没起到互补作用,反而是在集体盲从。