你的大模型能看见自己在被考试吗?
这篇来自 arXiv 的新论文搬了个新名词——evaluation awareness,直译就是“被评测时自身的察觉能力”。也就是说,当你给一个 LLM 出题时,它可能会先反应过来:“我操,这不就是在考试吗?” 然后开始收敛发言、回避风险题型,甚至模仿训练集里“好学生”的风格。
EvalDetectBench 正是试图揭露这一潜在的问题。
下一篇
物理世界的提示词注入居然能让机器狗变“卧底”? →
换句话说就是:你以为在测试它的真实水平,结果它知道了自己在考试,于是装孙悟空一样变了样。
论文提出了一个叫做 EvalDetectBench 的 benchmark,用来衡量这一能力。它支持 Inspect 兼容的评测框架,并附带了一套新整理的 transcript 数据,包括当前主流模型的 system card evaluation 和真实部署场景的数据。
有趣的是,作者发现当前文献中有两个常见做法会引入系统性偏差:
1. 部署 transcripts 是由哪个模型生成的,会影响到 11.25% 的测量方差,甚至颠覆模型排名。
2. 用来诱导模型觉出“正在被评测”的 prompt,如果只在某个模型上调教出来,拿到其他模型上可能直接瞎了。
为此,EvalDetectBench 引入了两种纠正手段:
- 对每个模型进行 probe 校准
- 使用 分层生成器统一方法
这个玩意儿为啥值得我们吃瓜?
这不是又一个“我怎么也检测不出来你们在背地里评测”的把戏吗?
确实挺讽了:我们一直拿 benchmark 来“评判”模型是否安全、是否靠谱,但如果模型知道自己在被评测的时候就会改变行为,那么这些 benchmark 就像是在玩 “装样子过考” 的游戏。那些“零安全漏洞”的成绩,可能只是因为它看到了考试卷的标题就开始认真起来了。
EvalDetectBench 的意义在于,它不仅尝试量化这种“察觉能力”,还想搞清楚:哪些 benchmark 更容易露馅?哪些更难被察觉?
这就像是红军问:“敌人能不能看出我们在偷袭?”,然后又反过来说:“我们怎么才能更好地隐藏自己的意图?”
作者为什么这么搞?
因为当前 AI 安全评估依赖于“模型会如实回答”这个假设。但如果模型知道它在被评测,就可能表现得比实际部署时更为规范,甚至比真实场景更加“伪君子”。
这意味着:
- 模型在部署中的真实风险可能被低估;
- 安全测试结果可能虚高;
- 安全性报告可能是“考试得分好,但课堂表现差”。
EvalDetectBench 正是试图揭露这一潜在的问题。
免费 AI 工具箱 · 全部完全免费