用 MUD 文字游戏实测发现 LLM 裁判机制存在严重打分偏差
现在的评测趋势是,因为人类标注成本太高且速度慢,业界习惯用一个能力更强的模型(比如 GPT-4o)作为裁判,给其他模型的输出打分。但在这场 MUD 模拟实验中,这种逻辑出现了严重的崩塌。
最诡异的细节在于,研究者在实验中设置了多个行为维度指标。当他们尝试去掉两个依赖 LLM 分类器的维度指标后,结果发生了剧烈波动——某个顶尖模型在排行榜上的名次竟然直接掉了 6 位。这意味着什么?这意味着该模型之前之所以能排在高位,很大程度上是因为裁判模型在主观感知上觉得它“表现不错”,而非它在游戏环境中的实际操作能力真的强。
为了验证这种不稳定性,作者引入了第二个裁判模型进行交叉验证。结果令人心惊:不同模型裁判之间的达成一致率(Agreement Rate)竟然在 22% 到 85% 之间剧烈波动。这意味着在某些评测维度上,两个顶级模型裁判对于同一个答案的判定结果,几乎等同于随机掷骰子。
通过对数据的深挖,我发现了两个非常值得深思的问题。首先是严重的噪声干扰,即使是目前最前沿的模型,在面对特定评测维度时,裁判模型的判定结果可能完全是随机的。其次是潜在的“同族偏好”。实验观察到,那些分数虚高、受影响最严重的模型,往往与裁判模型属于同一个家族。虽然这不能直接定论为偏见,但这种相关性暗示了模型可能在潜意识里更倾向于给“说话方式相似”的同类打高分。
这次研究的成本极低,作者仅使用了 99 美元的 API 额度就得出了这个结论,这给目前主流的 Benchmark 敲了警钟。当然,这项 PoC 研究也有局限性,比如每个模型仅运行了 50 次,且完全没有人类标注员介入,结果存在一定的偶然性。但它证明了一个核心事实:在复杂交互环境下,模型真实的执行能力与被裁判模型“感知”到的表现之间,存在巨大的鸿沟。
比起那些死记硬背、极易被训练集污染的静态测试集,这种将模型扔进模拟环境跑实操的方案显然更有说服力。它提醒我们,如果一个 Benchmark 仅仅依赖模型打分,而缺乏客观的物理指标(比如在 MUD 中是真正执行了“打开门”的指令,还是仅仅在对话中声称自己打开了门),那么这个排名其实是非常脆弱的。
如果你想复现或者研究具体实现,可以去查阅 DOI 为 10.5281/zenodo.21386663 的相关数据和代码。看看在这种低成本实验下,模型裁判是如何在 22% 的低一致率中“迷失”的,这对于我们构建更客观的评测体系非常有参考价值。