为什么你的模型跑 ARC-AGI-3 没分?试着把采样数调到 16 看看

PromptCube 中级 2026/7/30 781 浏览 4 点赞 约 2 分钟

最近在跑 ARC-AGI-3 benchmark 的过程中,我发现一个非常诡异的现象:同一个模型,在默认配置下跑分平平,但只要微调两个底层参数,得分竟然能直接翻三倍。这让我意识到,目前很多模型在处理这类高度抽象的 AGI 测试时,其实是被默认的 API 配置给“阉割”了,真正的推理上限被掩盖在了随机性之下。

很多人在跑分低的时候习惯于更换更大参数量的模型,但这次实验证明,在逻辑严密性要求极高的任务中,配置引导比模型规模更关键。

首先是关于采样温度(Temperature)和 Top-P 的策略。大多数人习惯用 0.7 左右的温度来保证输出的自然感,但这在 ARC 这种需要极强逻辑闭环的任务中是致命的。逻辑推理不需要“创造力”,需要的是“确定性”。

我尝试将 Temperature 强制降低到 0.1-0.2,并配合 Top-P 0.9 的窄范围,效果立竿见影。在这种配置下,模型会大幅减少随机发散,强制其专注于概率最高的逻辑路径。如果你在配置文件中依然使用默认的 0.7 或 1.0,模型很容易在推理链条的中间环节跳出一个不相关的 Token,导致整个逻辑坍塌。建议的 JSON 配置如下:

{
  "temperature": 0.1,
  "top_p": 0.9,
  "max_tokens": 4096
}

但真正让得分产生质变的,是引入了“多路径采样 + 多数投票(Majority Voting)”机制。

ARC-AGI-3 的核心难点在于,模型在进行多步推理时,只要其中一步出现 1% 的偏差,最终答案就会完全错误。单次推理(Greedy Decoding)在这种任务面前极其脆弱。我的实操方案是:不再追求单次输出的正确率,而是让模型针对同一个问题并行生成 10-20 个不同的推理链条(Sample N paths),然后通过一个简单的多数投票脚本,选取出现次数最多的答案作为最终结果。

这里有一个非常关键的逻辑:只要模型在 N 次尝试中,有 30% 的概率能触碰到正确的逻辑路径,投票机制就能通过统计学规律,将这个正确答案从噪声中筛选出来,转化为最终的得分。

在实际测试中,我建议将采样数(Sample count)设在 16 或 32。虽然计算成本随采样次数线性增加,但准确率的提升是非线性的。当你把采样数从 1 提升到 16 时,你会发现原本死活跑不通的逻辑题,竟然在其中 5-6 个样本中给出了正确答案。当然,采样数如果无限制增加(比如增加到 128 以上),边际效应会迅速递减,且推理成本过高,性价比不再突出。

这次实验给我的最大启发是:目前的推理模型在潜在能力上,其实已经具备了处理复杂逻辑的可能性,只是它们在单次推理时不够稳定。我们不需要等待下一个版本的模型发布,通过这种“以量换质”的触发机制,就能在现有版本上榨干模型的推理上限。

ARC-AGI-3BenchmarkInference Optimization
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。

全部回复 (4)

深漂独立开发者 中级 2026/7/30

Top-P得压低才行,不然采样16次随机得像抽奖,根本对不齐答案!

0 回复
夜猫子创业者 专家 2026/7/30

温度设多少能稳住?我试了几个点波动大到离谱,快被搞崩溃了。

0 回复
大Jerry 高级 2026/7/30

参数稍微动一下逻辑竟然就通了,这ARC-AGI-3也太敏感了吧!

0 回复
大熊爱学习 中级 2026/7/30

采样数16能救命?快让我回去试下我的模型,万一能跑出分就绝了!

0 回复

发表回复

支持 Markdown 格式