别被 Opus 5 的 ARC 高分给骗了,这可能是典型的刷榜行为
简单来说,如果一个模型在训练阶段就“见过”了 ARC 的测试集,它就不再是进行逻辑推演,而是在进行高效的记忆检索。这种现象在当前的 LLM 竞争中极其普遍,很多厂商为了在公开榜单上抢占高地,会不自觉地将测试集包含在预训练或 SFT(监督微调)数据中。当一个模型通过“背答案”而非“推逻辑”来拿到高分时,这个分数的参考价值就会大打折扣。
那么,在分数失效的情况下,我们如何判断一个模型是否真的在逻辑能力上有了质的飞跃?我建议抛弃所有第三方榜单,直接用以下三个硬指标进行实操压测:
首先是零样本(Zero-shot)的泛化能力。不要给它任何示例,直接抛出一个完全脱离常规训练分布的冷门场景。比如,你可以设定一套极其古怪的虚拟物理规则(例如:在这个世界里,圆形的物体在接触到蓝色背景时会向上漂浮),然后问它一个基于此规则的推演问题。如果模型能够瞬间理解并正确执行,而不是试图用现实世界的物理常识来纠正你,这才是真正的泛化。
其次是复杂逻辑链条的压力测试。很多模型在两步推理时表现完美,但一旦进入第三步、第四步的深度推演,就会出现典型的“逻辑崩塌”。你可以尝试使用多步推理的 Prompt,强制要求它在得出结论前,必须将中间步骤拆解为 Step 1, Step 2, Step 3。观察它在第三步之后是否开始出现事实性错误或逻辑循环。如果它在第二步之后就开始胡说八道,那么之前的 ARC 高分不过是某种统计学上的巧合。
最后,也是最关键的一点,就是代码实现的一致性。这是目前检验模型是否在“伪推理”的最有效手段。你可以要求模型先用自然语言推演一个逻辑问题,然后立即要求它将这个推演过程转化为一段可运行的 Python 代码。如果模型给出的结论是 A,但运行代码的结果却是 B,那么它之前的自然语言推演完全是基于概率生成的“看起来很对”的废话,而非真正的逻辑思考。
目前的现状是,衡量 AGI 进展的指标体系过于单一。如果整个行业都陷入这种“刷分”的内卷中,我们可能会产生一种模型已经接近通用智能的错觉。实际上,如果所有模型都通过记忆答案来拿高分,那么我们距离真正的 AGI 目标,可能比那些亮眼的数字所显示的要远得多。