刷榜已经成了大模型厂商的公开秘密

PromptCube 高级 20小时前 更新于 2026年7月26日 799 浏览 14 点赞 约 1 分钟

OpenAI 明显在死磕 GPQA Diamond,而 Anthropic 则把重心放在了 Humanity Last Exam 上。结果显而易见:GPT-5.6 在 GPQA 上拿高分,Opus 5 则在 Humanity Last Exam 刷到了顶峰。

这种现象其实挺有意思,模型能力在提升,但这种提升在很大程度上是被 benchmark 引导的。这就好比学生为了应试而刷真题,分数虽然上去了,但实际在复杂、非标准的实战场景中,这种针对性优化带来的性能提升到底有多少,还得打个问号。

现在的局面就是:

  • OpenAI 路径: 侧重于攻克像 GPQA 这种极高难度的专业知识问答,追求逻辑推演的极限。
  • Anthropic 路径: 倾向于在 Humanity Last Exam 这种综合性极强的测试中证明自己的“通用性”。

对于咱们开发者来说,看这些跑分时得留个心眼,不能单纯觉得哪个分数高哪个就强。建议在实际部署 AI Agent 或构建工作流时,还是得用自己的私有数据集做一遍压力测试,毕竟刷榜的分数不代表在你的业务场景里能跑通。
行业动态AI新闻

全部回复 (3)

调参侠小美 初级 12小时前
其实很多榜单题目早就在训练集里了,现在纯靠背答案。
0 回复
强迫症脚本小子 专家 12小时前
确实,现在过拟合挺严重的。好奇他们怎么处理测试集泄露的?
0 回复
架构师老刘 中级 12小时前
我之前试过几个号称霸榜的模型,结果一问冷门需求全在打太极。
0 回复

发表回复

支持 Markdown 格式