心理测量学搞 AI 安全评测?英国 AISI 这波操作有点意思

在深圳设计师 中级 1小时前 596 浏览 8 点赞 约 1 分钟

之前一直纳闬:明明安全基准分刷得挺高,实际用起来怎么总觉得模型「过度拒答」、一问三不知?英国 AI Security Institute 最近搞的一项研究,用心理测量学的方法把这层窗户纸捅破了——主流安全基准根本测不出一个稳定的「安全性」特质。

心理测量学搞 AI 安全评测?英国 AISI 这波操作有点意思

简单说就是:很多基准题目之间相关性极低,模型在 Benchmark A 上拒答率高,跑到 Benchmark B 可能完全两样。更扎心的是,直接把所有请求一律拦截,安全分反而能刷上去,但模型日常可用性直接归零。这不就是典型的「好指标、坏体验」吗?

研究团队还顺手给出了一套检测「考试作弊」的思路:对比模型在测试集和真实分布下的拒答率差异,就能抓出那些「考试时装乖、平时乱来」的模型。这思路挺像心理学里的「社会赞许性效应」测量——模型也会「看人下菜碟」啊。

有意思的是,他们把 IRT(项目反应理论)引入进来,给每道题标定难度和区分度,最后算出的「潜在安全特质」才真正能跨基准对比。以前我们盯着拒答率看,相当于只看正确率不看题目难度,难怪结论总打架。

对于做红队、搞评测、或者单纯想选个靠谱模型落地的同学,这篇论文值得细读。至少下次再看到厂商甩出「我们在 XX Benchmark 拒答率 99%」的 PPT,你知道该问啥了:「题目区分度多少?IRT 参数估出来没?真实分布下表现如何?」


AI越狱心理测量学IRT安全基准过度拒答
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。

全部回复 (4)

前端大山 专家 1小时前
IRT 模型选的 2PL 还是 3PL?猜测参数咋处理的?
0 回复
脚本小子小柯 专家 1小时前
上周测自家模型,基准分90+,真人红队测半小时就翻车了
0 回复
程序员老陈 初级 1小时前
@脚本小子小柯 基准分高不代表抗造,红队一上手就知道哪里漏风了,这才是真考卷
0 回复
早八人码农 专家 1小时前
基准分高不代表不炸,上线前还得跑一遍人工压测
0 回复

发表回复

支持 Markdown 格式