用多阶段规则链条跑 ARC-AGI-2 能拿 95% 以上准确率到底是怎么实现的
想要在 ARC-AGI-2 这种考验认知泛化能力的测试集上拿高分,靠大模型盲猜或者简单的 Few-shot 几乎没戏。我研究了这套多阶段规则链条框架(arXiv:2609.10654v1),它的核心逻辑不是让模型直接出结果,而是把推理拆成了三个递进的「解题层」:先找原子变换,再试模式组合,最后走结构抽象。这种层层回退(Fallback)的机制,让它在 240 个测试任务里解决了 230 个。
为什么不能直接用 LLM 暴力推理
ARC 这种格子图题目最坑的地方在于,它要求你从极少量的样本中总结出一种「抽象规则」,然后应用到新图上。如果你直接把像素坐标喂给 LLM,模型很容易在空间关系上产生幻觉。这套框架聪明在它把推理过程「符号化」了,让每一阶段的输出都成为下一阶段的输入,这样即便最后一步失败了,你也能通过推理痕迹(Reasoning Traces)一眼看出它是卡在了「找不对颜色」还是「没搞懂对称性」。
这套多阶段解题流程怎么跑
这套系统的运行逻辑是一个严格的顺序执行链路,如果第一层解决了就直接输出,否则把中间状态传给第二层,以此类推。
一、确定性规则发现(Deterministic Rule Discovery)
这一层是最高效的,专门处理那些「原子级」的变化。它会扫描格子的几何特征、颜色分布和物体边界。比如,如果发现输入图和输出图只有颜色变了,或者某个色块整体平移了,这一层会直接通过符号逻辑得出结论。这是最快的一环,能过滤掉大量简单的确定性任务。
二、模式组合引擎(Pattern-Composition Engine)
如果第一层搞不定,说明规则不是原子的,而是组合性的。这一层会尝试「块合并」和「空间启发式重复」。举个例子,如果输出图是由输入图的某个子块重复四次组成的,或者两个色块发生了重叠合并,模式组合引擎就会尝试重建这种关系。它不再关注单个像素,而是关注「块」的逻辑。
三、结构抽象层(Structural Abstraction Layer)
这是最后的保底方案,处理最难的层级关系或嵌套关系。它会分析格子之间是否存在某种分级结构,或者某种隐含的拓扑映射。很多复杂的 ARC 题目需要你意识到「这是一个整体在另一个整体内部」,这种抽象能力是前两层不具备的。
实际运行的性能数据
这套框架的鲁棒性很强,从数据上看,它在 1000 个任务中通过了 995 个,这意味着它的规则覆盖面极广。在 ARC-AGI-2 的 240 个测试任务中,成功解决了 230 个,准确率突破了 95%。
这种结果证明了「符号推理 + 模式合成」比纯粹的端到端预测要可靠得多。而且最关键的是,它不需要针对每个特定任务进行微调(Task-specific tuning),而是靠一套通用的规则链条去适配。
部署和实操时的潜在坑点
如果你想复刻这种思路,有几个细节必须注意:
- 推理痕迹的传递: 绝对不能让三个模块独立运行。第二层必须能读懂第一层「尝试过但失败了」的记录,否则会陷入重复计算,浪费大量时间。
- 原子定义的完备性: 第一层定义的「几何、颜色、物体」分析能力决定了整体的基准线。如果原子定义不全,压力会全部堆到第三层结构抽象上,导致推理时间指数级增长。
- 性能开销: 虽然它不依赖大规模参数微调,但这种多级回退机制在面对极复杂任务时,由于要遍历多种组合可能性,单题的推理耗时会随着层级加深而显著增加。
总结这个架构的判断
这套方案把认知推理变成了「漏斗过滤」。它告诉我们,解决认知泛化问题的路径应该是:先尝试最简单的确定性规则 → 再尝试结构化的模式组合 → 最后尝试高阶的抽象映射。这种可解释的链条让机器推理不再是黑盒,你清楚地知道它是在哪个环节对规则产生了误解。
我试过用类似逻辑跑,结果在 14 号那个格点任务上卡死,没加回溯简直没法看。