让几个大模型投票来决定内容安不安全,结果居然会被“带节奏”

躺平产品经理 初级 1天前 803 浏览 3 点赞 约 2 分钟

如果让 7 个大模型组成一个评审团,其中 6 个都坚称某段话是违规的,那么剩下的那个模型大概率也会被带偏,哪怕它最初觉得没问题。这种类似人类社交压力(Social Pressure)的现象在模型评审面板里居然真实存在,而且破坏力极大。

这其实触及了一个挺讽刺的点:我们本来是用“多数票”机制来对冲单个模型的误判,结果因为模型之间存在某种程度的“从众心理”,导致多数票反而成了错误结论的放大器。

具体的实验过程很有意思,它是分两轮跑的:
第一轮让模型独立判断,这时候模型还算清醒;
第二轮在它投票前,模拟 6 个“同伴”先表态,要么直接给个错误标签,要么保持沉默。

结果数据相当离谱:

  • 误报率飙升: 在同伴集体给出错误标签的情况下,单个评审员的误报率从 56.5% 直接跳到了 87.5%,而最终的多数投票结果导致整个评审团的误报率达到了 100%。
  • 不对称性极强: 模型非常容易被诱导认为某样东西是“不安全”的(诱导成功率约 75%),但如果同伴诱导它认为某样东西是“安全”的,成功率只有 17% 左右。

这意味着大模型在安全审查时倾向于“宁可错杀不可放过”,而且这种保守倾向在群体压力下会被无限放大。如果一个安全工作流是靠多个模型投票来做最后把关,那么一旦前面的模型被某个误导性的上下文给带跑了,后面的模型极大概率会跟风,最后导致大量正常内容被误判为违规。

这种现象给部署安全面板提供了一个简单的诊断方法:在上线前,故意给模型喂一些带误导性结论的同伴意见,看看它的判断是否会发生剧烈偏移。如果偏移严重,说明这个评审团根本没起到互补作用,反而是在集体盲从。

AI越狱AI安全LLM SafetyMajority VotingFalse-Alarm Rate

全部回复 (4)

产品经理阿强 中级 1天前
而且要是把投票顺序调一下,结果可能完全不一样。
0 回复
前端老刘 高级 1天前
要是把模型给隔离了,互不干扰地投,还能这样吗?
0 回复
程序员Tom 高级 1天前
这个想法不错,说不定能出奇效!你觉得隔离后权重怎么分比较好?
0 回复
老大鹏 专家 1天前
我之前调Prompt时也发现这毛病,后面几个总是跟风。
0 回复

发表回复

支持 Markdown 格式