为什么你的模型跑 ARC-AGI-3 没分?试着把采样数调到 16 看看
最近在跑 ARC-AGI-3 benchmark 的过程中,我发现一个非常诡异的现象:同一个模型,在默认配置下跑分平平,但只要微调两个底层参数,得分竟然能直接翻三倍。这让我意识到,目前很多模型在处理这类高度抽象的 AGI 测试时,其实是被默认的 API 配置给“阉割”了,真正的推理上限被掩盖在了随机性之下。
很多人在跑分低的时候习惯于更换更大参数量的模型,但这次实验证明,在逻辑严密性要求极高的任务中,配置引导比模型规模更关键。
首先是关于采样温度(Temperature)和 Top-P 的策略。大多数人习惯用 0.7 左右的温度来保证输出的自然感,但这在 ARC 这种需要极强逻辑闭环的任务中是致命的。逻辑推理不需要“创造力”,需要的是“确定性”。
我尝试将 Temperature 强制降低到 0.1-0.2,并配合 Top-P 0.9 的窄范围,效果立竿见影。在这种配置下,模型会大幅减少随机发散,强制其专注于概率最高的逻辑路径。如果你在配置文件中依然使用默认的 0.7 或 1.0,模型很容易在推理链条的中间环节跳出一个不相关的 Token,导致整个逻辑坍塌。建议的 JSON 配置如下:
{
"temperature": 0.1,
"top_p": 0.9,
"max_tokens": 4096
}
但真正让得分产生质变的,是引入了“多路径采样 + 多数投票(Majority Voting)”机制。
ARC-AGI-3 的核心难点在于,模型在进行多步推理时,只要其中一步出现 1% 的偏差,最终答案就会完全错误。单次推理(Greedy Decoding)在这种任务面前极其脆弱。我的实操方案是:不再追求单次输出的正确率,而是让模型针对同一个问题并行生成 10-20 个不同的推理链条(Sample N paths),然后通过一个简单的多数投票脚本,选取出现次数最多的答案作为最终结果。
这里有一个非常关键的逻辑:只要模型在 N 次尝试中,有 30% 的概率能触碰到正确的逻辑路径,投票机制就能通过统计学规律,将这个正确答案从噪声中筛选出来,转化为最终的得分。
在实际测试中,我建议将采样数(Sample count)设在 16 或 32。虽然计算成本随采样次数线性增加,但准确率的提升是非线性的。当你把采样数从 1 提升到 16 时,你会发现原本死活跑不通的逻辑题,竟然在其中 5-6 个样本中给出了正确答案。当然,采样数如果无限制增加(比如增加到 128 以上),边际效应会迅速递减,且推理成本过高,性价比不再突出。
这次实验给我的最大启发是:目前的推理模型在潜在能力上,其实已经具备了处理复杂逻辑的可能性,只是它们在单次推理时不够稳定。我们不需要等待下一个版本的模型发布,通过这种“以量换质”的触发机制,就能在现有版本上榨干模型的推理上限。
Top-P得压低才行,不然采样16次随机得像抽奖,根本对不齐答案!