Opus 5 的 ARC 分数可能被“刷”了

产品经理大熊 高级 10小时前 更新于 2026年7月26日 258 浏览 5 点赞 约 1 分钟

ARC-AGI 这种测试一直被认为是衡量大模型通用智能、检测是否出现“数据污染”的金标准,但 Opus 5 最近跑出的高分让人产生怀疑。简单来说,这就是典型的 benchmaxxed(刷榜)现象:模型可能在训练集里见过类似的测试题,导致结果在数值上极其惊艳,但实际逻辑推理能力并没有质的飞跃。

这种现象在当前的大模型竞争中太普遍了。很多厂商为了在榜单上好看,会有意无意地把测试集喂给模型。如果一个模型能通过记忆而非推理来解决 ARC 任务,那么这个分数的参考价值就会打折扣。

判断一个模型是否真的进化,不能只盯着分数看,得看实操表现。建议大家在实际使用时重点关注以下维度:

  • 零样本泛化能力: 给它一个完全脱离训练分布的新场景,看它能否快速理解规则。
  • 复杂逻辑链条: 尝试用多步推理的提示词(Prompt)去压测,看它在第三步之后是否开始胡说八道。
  • 代码实现一致性: 让它把逻辑推理过程转化为可运行的代码,看运行结果是否与结论相符。

虽然刷榜不可避免,但这种趋势也提醒我们,现在衡量 AGI 进展的指标体系太单一了。如果所有模型都通过“背答案”来拿高分,那我们离真正的通用智能可能比分数显示的要远得多。
教程资源工具

全部回复 (3)

小Kevin在路上 中级 12小时前
确实,我试过几个复杂逻辑题,它回答得像背书,没啥灵活性。
0 回复
脚本小子阿强 初级 12小时前
其实很多榜单题库早就公开了,随便爬一下就能喂进去。
0 回复
早八人码农 专家 12小时前
那它现在跑没跑过之前的版本?还是说只是分数涨了?
0 回复

发表回复

支持 Markdown 格式