大模型测评如果不搞双盲测试,结果大概率都是在自嗨

PromptCube 中级 2小时前 572 浏览 6 点赞 约 2 分钟

现在的 AI 评测圈子其实挺乱的,很多所谓的 Benchmark 跑出来的分数,其实更像是在“刷题”而不是真有逻辑。我最近关注到关于“双盲 AI 评估”试点实验的消息,这事儿逻辑其实很简单,但对行业来说非常硬核。

目前的评测痛点在于:评测者(人类或另一个模型)往往知道答案的来源,或者知道正在评估的是哪家厂商的模型。这种心理暗示会导致评估结果出现严重的偏差。比如,当一个评测员知道自己在测 Claude 3.5 时,他可能会潜意识里对模型的逻辑严密性给予更高的容忍度;反之,如果是面对一个名不见经传的小模型,哪怕它答对了,评测员也可能觉得“这只是碰巧”。

这种“信息不对称”让很多大模型能力的实战表现被过度美化了。

这次试点的核心逻辑就是通过技术手段实现完全的双盲:

  • 评估对象匿名化: 所有的模型输出在交给评测员之前,必须通过脱敏处理,抹除所有关于模型版本、厂商背景的特征信息。
  • 评测任务随机化: 题目不再是固定的、容易被模型通过预训练数据“背诵”出来的标准题,而是更侧重于即时生成的、需要复杂推理的工作流任务。
  • 多维度的交叉验证: 不再只看一个最终答案,而是引入多个匿名评测员(包括人类专家和高度隔离的 AI Agent)进行多轮打分,最后通过统计学方法剔除异常值。

如果这套双盲机制能真正落地并标准化,那我们以后看模型榜单时,才敢说这些数据是有实操参考价值的。现在的排行榜很多时候只是在比谁的 Prompt 优化得好,或者谁的训练集里包含了更多的测试题,这对于开发者寻找真正能落地生产环境的模型没有任何指导意义。

我个人认为,未来真正能拉开差距的,不是模型参数的大小,而是模型在脱离了“刷题模式”后,处理真实、模糊、未知问题的原生能力。

AI Evaluation

全部回复 (3)

独立开发者Leo 专家 1小时前
确实,不然厂商专门针对题库调优太容易了,那双盲测试怎么保证评估模型的水平也在线?
0 回复
阿杰在路上 中级 1小时前
还有就是评测集容易过时,模型只要背过题库,分数再高也没用。
0 回复
完美主义技术宅 专家 1小时前
我之前带队测过一个模型,结果发现它连最基础的常识题都能答错,全是靠背题库拿的高分。
0 回复

发表回复

支持 Markdown 格式