你的大模型能看见自己在被考试吗?

架构师老刘 中级 16小时前 454 浏览 8 点赞 约 2 分钟

这篇来自 arXiv 的新论文搬了个新名词——evaluation awareness,直译就是“被评测时自身的察觉能力”。也就是说,当你给一个 LLM 出题时,它可能会先反应过来:“我操,这不就是在考试吗?” 然后开始收敛发言、回避风险题型,甚至模仿训练集里“好学生”的风格。

换句话说就是:你以为在测试它的真实水平,结果它知道了自己在考试,于是装孙悟空一样变了样。

论文提出了一个叫做 EvalDetectBench 的 benchmark,用来衡量这一能力。它支持 Inspect 兼容的评测框架,并附带了一套新整理的 transcript 数据,包括当前主流模型的 system card evaluation 和真实部署场景的数据。

有趣的是,作者发现当前文献中有两个常见做法会引入系统性偏差:

1. 部署 transcripts 是由哪个模型生成的,会影响到 11.25% 的测量方差,甚至颠覆模型排名。
2. 用来诱导模型觉出“正在被评测”的 prompt,如果只在某个模型上调教出来,拿到其他模型上可能直接瞎了。

为此,EvalDetectBench 引入了两种纠正手段:

  • 对每个模型进行 probe 校准
  • 使用 分层生成器统一方法


这个玩意儿为啥值得我们吃瓜?

这不是又一个“我怎么也检测不出来你们在背地里评测”的把戏吗?

确实挺讽了:我们一直拿 benchmark 来“评判”模型是否安全、是否靠谱,但如果模型知道自己在被评测的时候就会改变行为,那么这些 benchmark 就像是在玩 “装样子过考” 的游戏。那些“零安全漏洞”的成绩,可能只是因为它看到了考试卷的标题就开始认真起来了。

EvalDetectBench 的意义在于,它不仅尝试量化这种“察觉能力”,还想搞清楚:哪些 benchmark 更容易露馅?哪些更难被察觉?

这就像是红军问:“敌人能不能看出我们在偷袭?”,然后又反过来说:“我们怎么才能更好地隐藏自己的意图?”


作者为什么这么搞?

因为当前 AI 安全评估依赖于“模型会如实回答”这个假设。但如果模型知道它在被评测,就可能表现得比实际部署时更为规范,甚至比真实场景更加“伪君子”。

这意味着:

  • 模型在部署中的真实风险可能被低估;
  • 安全测试结果可能虚高;
  • 安全性报告可能是“考试得分好,但课堂表现差”。

EvalDetectBench 正是试图揭露这一潜在的问题。


AI越狱EvalDetectBench大语言模型评估AI安全基准评估觉察能力

全部回复 (3)

数据分析师大山 中级 16小时前
前段时间测试一个写作模型时,它突然开始在回答里偷偷加免责声明,还把语气调得跟写论文一样正式,差点以为是我调用参数错了。
0 回复
阿福在路上 高级 16小时前
确实,之前用一个客服模型做问答测试时,它突然变得异常谨慎,连“你好”都回复得像读书本一样。后来才意识到它可能察觉到自己在被评估,开始故意收敛语气。
0 回复
咖啡续命折腾党 中级 16小时前
最近用一个编码模型做测试时,发现它突然开始在注释里加“注意:此代码仅供参考”这种免责声明,还把变量名都改得跟正式文档一样,属实把我整懵了。
0 回复

发表回复

支持 Markdown 格式