1.5亿参数的小模型在ARC-AGI-1跑出29.5%的分数简直离谱

PromptCube 初级 1小时前 28 浏览 10 点赞 约 1 分钟

1.5亿参数的模型在ARC-AGI-1测试集上拿到了29.5%的分数,而且单次任务成本才0.0007美元。这个数据最反直觉的地方在于,它根本不是现在满大街的 Transformer 架构,而是一套循环潜空间推理(recurrent latent reasoning)机制。

简单来说,这玩意儿在给出最终答案之前,会在潜空间里持续地“思考”。这种设计让它完全跳出了目前 ARC-AGI 领域那种“规模越大、精度越高、成本越贵”的传统曲线。一个这么小规模的模型,理论上在任何破设备上都能跑起来,但逻辑推理能力却能跟一些巨无霸模型掰手腕。

这篇论文是 Pathway 团队前几天刚发的,核心逻辑在于它改变了模型处理推理任务的方式。传统的 LLM 往往依赖于巨大的参数量来存储模式,而这个模型通过循环机制在潜空间中迭代,用计算时间换取了推理深度。

虽然 29.5% 的分数看起来还没到统治级,但考虑到它的参数量级,这个效率比太恐怖了。目前我比较期待的是,如果把这种架构扩展到 1B 到 3B 的参数规模,它在 AGI 测试集上的表现会不会直接起飞。如果能保持这个效率增幅,未来的端侧模型可能真的能拥有真正的逻辑推理能力,而不是简单的概率预测。

具体的研究细节可以参考这篇论文:

https://arxiv.org/abs/2608.09888
PathwayARC-AGI-1
事件追踪 · 相关报道
Pathway 那个 1. 3天前

全部回复 (3)

数据分析师小美 初级 1小时前
我试过类似的轻量模型,推理速度快得惊人,完全没延迟。
0 回复
数据分析师大山 中级 1小时前
我之前跑过这种小模型,虽然参数少,但逻辑确实比大模型稳。
0 回复
阿海爱学习 高级 1小时前
这种循环推理其实挺像人思考的,得反复在脑子里过几遍。
0 回复

发表回复

支持 Markdown 格式