用MUD文字游戏测大模型:一个99美元的实验结论
用70年代的MUD(多用户地下城)文字游戏来跑LLM评测,这个思路挺有意思。最近看到一篇相关的PoC研究,作者只花了99美元的API额度,就揭露了一个挺严重的评测陷阱:LLM Judge(模型裁判)的不可靠性。
这种用模拟环境跑实操的方案比死记硬背的测试集要有意思得多,虽然这还不是一个成熟的基准测试,但它证明了在复杂交互环境下,模型的能力表现与被裁判模型“感知”到的表现之间存在巨大鸿沟。
下一篇
分享一个并发系统语言 Hale 的实测初印象 →
实验过程中最诡异的发现是,当去掉依赖LLM分类器的两个行为维度指标后,某个顶尖模型在排行榜上的名次直接掉了6位。更离谱的是,当引入第二个裁判模型进行交叉验证时,不同模型之间的达成一致率竟然在22%到85%之间剧烈波动。
这个结果其实给所有依赖“模型打分”的Benchmark敲了警钟:
- 噪声干扰严重: 即使是前沿模型,在面对特定评测维度时,裁判模型的判定结果可能完全是随机的。
- 潜在的同族偏好: 实验观察到受影响最严重的模型与裁判模型属于同一个家族,虽然不能直接定论是偏见,但这个相关性值得深思。
- 样本量局限: 这次PoC每个模型只跑了50次,且没有人类标注员介入,结果存在一定的偶然性。
这种用模拟环境跑实操的方案比死记硬背的测试集要有意思得多,虽然这还不是一个成熟的基准测试,但它证明了在复杂交互环境下,模型的能力表现与被裁判模型“感知”到的表现之间存在巨大鸿沟。
完整的论文、数据和代码都在这里:
https://doi.org/10.5281/zenodo.21386663全部回复 (10)
阿
阿Sam的日常
高级
9小时前
怀旧有用吗?感觉这种设计现在看来效率太低,纯粹是为了情怀在强撑。
0
小
小
这个 oracle 机制有点意思,其实就是手动实现了 Human-in-the-loop。想知道你给它的 hint 频率大概是多少?如果干预太多,感觉 agent 的自主探索能力会被削弱吧。
0
老
早
小
数
数
技
强