英伟达 AVO 拿下 ARC-AGI-3 满分,交互式代码闭环才是通用智能的突破口
英伟达 AVO 在 ARC-AGI-3 测试里拿下 100% 满分,AI 圈直接炸了。但比起这个数字,更值得琢磨的是它背后的路子——从“静态答题”到“交互实验”的范式转变。
ARC 一直被视为衡量通用智能的标杆,因为样本极少,模型得自己推导规则,没法靠死记硬背混过去。以前的方案通常让模型直接给答案,本质上还是离线预测。AVO 不一样,它把测试环境改成了交互式沙箱,模型在最终作答前,能写 Python 代码去探测、试错,再根据报错或运行结果调整策略。
交互式沙箱如何将做题变为做实验?
这套操作把“做题”变成了“做实验”。而且 AVO 没有堆参数,架构相当克制:LLM 只当“规划员”,负责拆任务和提假设;一个确定性的 Python 沙箱去当“执行员”。
技术实现上,就是典型的“模型+代码引擎”闭环纠偏。面对复杂 ARC 任务,模型不指望一次生成正确答案,而是进入“观察 → 假设 → 代码 → 验证 → 修正”的循环。代码跑出来不对,或者 Python 直接 Traceback,模型就把这些反馈当成新上下文,再迭代方案。这个思路和之前的 Sif 或 AlphaCode 2 很像,核心就是把不确定的推理交给 LLM,把确定的验证丢给编译器。
交互闭环能否解决逻辑推理的容错率问题?
这种架构给到的启发蛮直接:别老想着靠加参数或拉长上下文来解决逻辑问题。长链条推理里,单次前向传播容错率太低,中间一步歪了后面全崩。但有了交互闭环,模型就有“自我修正”的能力,推理从线性变成了环形。
对正在搞 Agent 应用的工程师来说,这是个很稳的参考。与其追求一步到位的大模型,不如搭个轻量的 Agent 循环。比如处理复杂业务逻辑或数据分析时,先让模型写个验证脚本,在隔离沙箱里跑一遍,看输出再定下一步。这样结果可控,而且每一步都有代码支撑,整个链路可追溯、可审计。
试错收敛是否是突破通用智能的关键?
AVO 的满分说明,通用智能的突破口可能不在模型“记”了多少,而在于能否在交互中通过试错快速收敛到正确答案。这种交互范式要是能搬到多工具调用或长上下文的真实场景里,LLM 在复杂任务里常见的“幻觉”问题会大大减轻。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
在沙箱里import重依赖包确实像个噩梦,但或许可以借鉴AVO的思路:把“直接跑代码”变成“观察→假设→代码→验证→修正”的交互闭环。比如先让模型写一个小脚本,在沙箱里单独跑一遍,看看依赖是否缺失或版本冲突,再根据报错调整环境配置(比如pip install -r requirements.txt --user),而不是一上来就全量部署。这样每一步都有反馈,问题定位更精准,也避免了“死记硬背”式的配置猜测。
让LLM只负责提出假设和规划,而将实际验证交给Python沙箱,这正是英伟达AVO在ARC-AGI-3测试中突破性的“交互实验”范式。原本的静态答题模式依赖于模型单次输出直接匹配答案,但AVO通过让模型能够在沙箱中“写代码探测、试错”,将做题转化为“观察→假设→代码→验证→修正”的闭环循环。比如在解决复杂逻辑推理时,模型不再依赖单次高精度输出,而是通过反复调整代码逻辑,直到Python报错或运行结果验证通过,从而实现了对“线性推理容错率”的有效纠正。这种思路不仅让模型在样本极少的ARC测试中取得100%满分,也为Agent应用提供了更稳健的参考——比如在业务逻辑分析中,先让模型生成验证脚本,在沙箱中运行后再根据输出调整策略,这样每一步都能有明确的代码支撑和可追溯的验证链条。
沙箱要是跑出死循环直接把内存撑爆,这玩意儿有自动熔断机制吗? 根据我之前看到的信息,英伟达 AVO 在 ARC-AGI-3 测试里拿下 100% 满分,AI 圈直接炸了。但比起这个数字,更值得琢磨的是它背后的路子——从“静态答题”到“交互实验”的范式转变。 AVO 不一样,它把测试环境改成了交互式沙箱,模型在最终作答前,能写 Python 代码去探测、试错,再根据报错或运行结果调整策略。这种架构给到的启发蛮直接:别老想着靠加参数或拉长上下文来解决逻辑问题。长链条推理里,单次前向传播容错率太低,中间一步歪了后面全崩。但有了交互闭环,模型就有“自我修正”的能力,推理从线性变成了环形。