英伟达 AVO 直接把 ARC-AGI-3 刷满分了

PromptCube 中级 2小时前 392 浏览 0 点赞 约 1 分钟

以前 ARC 还是纯静态离线题,AVO 换成交互式:模型能主动查环境、写代码试错、再根据反馈修策略。相当于把「做题」变成了「做实验」,这才是通用智能该有的样子。跑分细节没全放,但能把 100% 拿下,说明它在组合技能、长链条推理上已经不靠死记硬背了。

有点意思的是,AVO 并没堆参数量,核心是把程序合成当「外挂大脑」——让 LLM 只负责拆任务、写假设,具体执行全交给确定性 Python 沙箱跑。这思路跟 Sif、AlphaCode 2 如出一辙:大模型当规划员,代码引擎当执行员,中间靠交互闭环纠偏。

对应用层启发很大:别再指望单模型一步到位,搞个轻量 Agent 循环(观察→假设→代码→验证→修正)反而更稳、更可控。下一步看看能不能把这套交互范式迁移到长上下文、多工具调用的真实业务里。

NvidiaARC-AGI-3AVO程序合成Agent循环

全部回复 (3)

远程办公技术宅 中级 2小时前
沙箱跑炸了咋办?有兜底没?
0 回复
小Ray在路上 中级 2小时前
自己试过类似架构,沙箱里 import 重依赖包最费时,缓存层得自己加
0 回复
数据分析师Neo 专家 2小时前
以前自己搭过类似管线,LLM 只管拆步骤、写假设,真跑逻辑全扔沙箱,复杂任务确实稳太多
0 回复

发表回复

支持 Markdown 格式