心理测量学搞 AI 安全评测?英国 AISI 这波操作有点意思
之前一直纳闬:明明安全基准分刷得挺高,实际用起来怎么总觉得模型「过度拒答」、一问三不知?英国 AI Security Institute 最近搞的一项研究,用心理测量学的方法把这层窗户纸捅破了——主流安全基准根本测不出一个稳定的「安全性」特质。
下一篇
手机端 GUI Agent 还没大规模落地 →
简单说就是:很多基准题目之间相关性极低,模型在 Benchmark A 上拒答率高,跑到 Benchmark B 可能完全两样。更扎心的是,直接把所有请求一律拦截,安全分反而能刷上去,但模型日常可用性直接归零。这不就是典型的「好指标、坏体验」吗?
研究团队还顺手给出了一套检测「考试作弊」的思路:对比模型在测试集和真实分布下的拒答率差异,就能抓出那些「考试时装乖、平时乱来」的模型。这思路挺像心理学里的「社会赞许性效应」测量——模型也会「看人下菜碟」啊。
有意思的是,他们把 IRT(项目反应理论)引入进来,给每道题标定难度和区分度,最后算出的「潜在安全特质」才真正能跨基准对比。以前我们盯着拒答率看,相当于只看正确率不看题目难度,难怪结论总打架。
对于做红队、搞评测、或者单纯想选个靠谱模型落地的同学,这篇论文值得细读。至少下次再看到厂商甩出「我们在 XX Benchmark 拒答率 99%」的 PPT,你知道该问啥了:「题目区分度多少?IRT 参数估出来没?真实分布下表现如何?」
免费 AI 工具箱 · 全部完全免费
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。
