ARC-AGI-3 跑分翻三倍:这两个关键设置直接决定了模型推理上限
很多跑 ARC-AGI-3 benchmark 的人可能没意识到,模型在逻辑推理上的表现其实对某些底层参数极其敏感。在实际测试中,仅仅通过调整两个关键设置,得分竟然直接翻了三倍,这说明目前的模型在处理这类高度抽象的 AGI 测试时,很大程度上被默认配置给限制住了。
这种通过“以量换质”的实战策略证明了,目前的推理模型在潜在能力上其实已经具备了处理复杂逻辑的可能性,只是需要更精准的触发机制。
下一篇
芯片股一天蒸发万亿美金,AI 泡沫论是不是真的回来了? →
这次提升的核心不在于模型规模的增加,而在于如何通过配置引导模型进入更深层的推理状态。具体的操作路径如下:
一、 优化采样温度与 Top-P 策略
默认的采样配置往往在创造力和稳定性之间取了一个折中值,但这在面对 ARC 这种需要极强逻辑严密性的任务时是不够的。通过将 Temperature 降低到 0.1-0.2,并配合一个较窄的 Top-P 范围,可以强制模型减少随机发散,专注于最可能的逻辑路径。
{
"temperature": 0.1,
"top_p": 0.9,
"max_tokens": 4096
}二、 引入多路径采样与多数投票(Majority Voting)
这是得分暴涨的最关键因素。ARC-AGI-3 的难点在于单次推理极易在某个逻辑环节出现偏差。通过开启多路径采样(Sample N paths),让模型对同一个问题生成 10-20 个不同的推理链条,然后通过多数投票机制选取出现次数最多的答案。这种方法有效地过滤掉了单次推理中的随机噪声,极大地提升了答案的鲁棒性。
- 推理成本: 计算量随采样次数线性增加,但准确率的提升是非线性的。
- 生效逻辑: 只要模型在 N 次尝试中能有 30% 的概率触碰到正确逻辑,投票机制就能将其转化为最终答案。
- 实操建议: 建议采样数设在 16 或 32,过高会导致边际效应递减。
这种通过“以量换质”的实战策略证明了,目前的推理模型在潜在能力上其实已经具备了处理复杂逻辑的可能性,只是需要更精准的触发机制。