Opus 5 的 ARC 分数可能被“刷”了
ARC-AGI 这种测试一直被认为是衡量大模型通用智能、检测是否出现“数据污染”的金标准,但 Opus 5 最近跑出的高分让人产生怀疑。简单来说,这就是典型的 benchmaxxed(刷榜)现象:模型可能在训练集里见过类似的测试题,导致结果在数值上极其惊艳,但实际逻辑推理能力并没有质的飞跃。
虽然刷榜不可避免,但这种趋势也提醒我们,现在衡量 AGI 进展的指标体系太单一了。如果所有模型都通过“背答案”来拿高分,那我们离真正的通用智能可能比分数显示的要远得多。
下一篇
分享 14 个开源 AI 工具清单 →
这种现象在当前的大模型竞争中太普遍了。很多厂商为了在榜单上好看,会有意无意地把测试集喂给模型。如果一个模型能通过记忆而非推理来解决 ARC 任务,那么这个分数的参考价值就会打折扣。
判断一个模型是否真的进化,不能只盯着分数看,得看实操表现。建议大家在实际使用时重点关注以下维度:
- 零样本泛化能力: 给它一个完全脱离训练分布的新场景,看它能否快速理解规则。
- 复杂逻辑链条: 尝试用多步推理的提示词(Prompt)去压测,看它在第三步之后是否开始胡说八道。
- 代码实现一致性: 让它把逻辑推理过程转化为可运行的代码,看运行结果是否与结论相符。
虽然刷榜不可避免,但这种趋势也提醒我们,现在衡量 AGI 进展的指标体系太单一了。如果所有模型都通过“背答案”来拿高分,那我们离真正的通用智能可能比分数显示的要远得多。