大模型测评如果不搞双盲测试,结果大概率都是在自嗨
现在的 AI 评测圈子其实挺乱的,很多所谓的 Benchmark 跑出来的分数,其实更像是在“刷题”而不是真有逻辑。我最近关注到关于“双盲 AI 评估”试点实验的消息,这事儿逻辑其实很简单,但对行业来说非常硬核。
如果这套双盲机制能真正落地并标准化,那我们以后看模型榜单时,才敢说这些数据是有实操参考价值的。现在的排行榜很多时候只是在比谁的 Prompt 优化得好,或者谁的训练集里包含了更多的测试题,这对于开发者寻找真正能落地生产环境的模型没有任何指导意义。
下一篇
美国搞个内战时期的法庭来讨伊朗石油,这招真的离谱 →
目前的评测痛点在于:评测者(人类或另一个模型)往往知道答案的来源,或者知道正在评估的是哪家厂商的模型。这种心理暗示会导致评估结果出现严重的偏差。比如,当一个评测员知道自己在测 Claude 3.5 时,他可能会潜意识里对模型的逻辑严密性给予更高的容忍度;反之,如果是面对一个名不见经传的小模型,哪怕它答对了,评测员也可能觉得“这只是碰巧”。
这种“信息不对称”让很多大模型能力的实战表现被过度美化了。
这次试点的核心逻辑就是通过技术手段实现完全的双盲:
- 评估对象匿名化: 所有的模型输出在交给评测员之前,必须通过脱敏处理,抹除所有关于模型版本、厂商背景的特征信息。
- 评测任务随机化: 题目不再是固定的、容易被模型通过预训练数据“背诵”出来的标准题,而是更侧重于即时生成的、需要复杂推理的工作流任务。
- 多维度的交叉验证: 不再只看一个最终答案,而是引入多个匿名评测员(包括人类专家和高度隔离的 AI Agent)进行多轮打分,最后通过统计学方法剔除异常值。
如果这套双盲机制能真正落地并标准化,那我们以后看模型榜单时,才敢说这些数据是有实操参考价值的。现在的排行榜很多时候只是在比谁的 Prompt 优化得好,或者谁的训练集里包含了更多的测试题,这对于开发者寻找真正能落地生产环境的模型没有任何指导意义。
我个人认为,未来真正能拉开差距的,不是模型参数的大小,而是模型在脱离了“刷题模式”后,处理真实、模糊、未知问题的原生能力。
免费 AI 工具箱 · 全部完全免费