那些刷爆了 MMLU 和 GSM8K 的模型在实操中为什么经常翻车
很多模型在发布会上敢吹 MMLU 拿了 90 分,HumanEval 接近满分,结果咱们上手一试,简单的推理逻辑还是会打结,碰到没见过的任务就抓瞎。其实这事儿很简单:现在的标准评测集已经“烂掉”了,它们衡量的是记忆力而不是真正的智能。
说白了,就是严重的“数据泄露”。测试集成了训练集的一部分,这就好比学生提前拿到了考试原题,考 100 分并不代表他掌握了知识,只代表他记性好。
下一篇
用本地跑 AutoClip 把长视频切成短视频短片真的快多了 →
这三个所谓的金标准其实都有同样的死穴:
- MMLU: 本质是多选题考知识点。问题是静态的,答案就在那儿,模型在训练阶段可能早就把题库背下来了。现在分数都顶到天花板了,根本分不出谁比谁强。
- GSM8K: 考小学数学应用题。原本想测推理,但因为题目太固定,模型通过模式识别就能给出答案,而不是真的在算数。
- HumanEval: 测代码生成。同样的问题,代码题在 GitHub 上到处都是,模型大概率是在“检索”答案而非“编写”逻辑。
说白了,就是严重的“数据泄露”。测试集成了训练集的一部分,这就好比学生提前拿到了考试原题,考 100 分并不代表他掌握了知识,只代表他记性好。
如果想真正测出一个模型好不好用,得看这几类评测:
一、动态评测
题目必须是实时生成的,不能是静态库。这样模型没法背答案,必须现场推理。
二、对抗性评测
专门设计一些陷阱题,故意在逻辑上绕弯子,看看模型在极端情况下的鲁棒性,而不是跑顺风球。
三、开放式实战任务
放弃选择题,直接给复杂的真实场景任务。比如让它完成一个完整的工作流,或者解决一个没有标准答案的工程问题。
现在的趋势是,评测重心正在从“跑分”转向“任务”。以后谁能解决实际生产中的痛点,谁才是真正的 SOTA,而不是看谁在旧题库里刷分更高。
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。