英伟达 AVO 直接把 ARC-AGI-3 刷满分了
以前 ARC 还是纯静态离线题,AVO 换成交互式:模型能主动查环境、写代码试错、再根据反馈修策略。相当于把「做题」变成了「做实验」,这才是通用智能该有的样子。跑分细节没全放,但能把 100% 拿下,说明它在组合技能、长链条推理上已经不靠死记硬背了。
有点意思的是,AVO 并没堆参数量,核心是把程序合成当「外挂大脑」——让 LLM 只负责拆任务、写假设,具体执行全交给确定性 Python 沙箱跑。这思路跟 Sif、AlphaCode 2 如出一辙:大模型当规划员,代码引擎当执行员,中间靠交互闭环纠偏。
对应用层启发很大:别再指望单模型一步到位,搞个轻量 Agent 循环(观察→假设→代码→验证→修正)反而更稳、更可控。下一步看看能不能把这套交互范式迁移到长上下文、多工具调用的真实业务里。
事件追踪 · 相关报道
英伟达把 GPU 变成「理财产品」了,黑石、阿波罗、高盛排队抢着买单
18小时前
Cerebras 那块盘子大的芯片真能打赢 H100 吗?
1天前
英伟达这波财务操作我真看不懂,回购规模直接砸下500亿美金
1天前
用 PantheonGPU 把显卡跑一遍压力测试才发现温度正常不代表
2天前
这家估值 210 亿美元的 Kids in Chips 到底在抢英伟
3天前
微软要是搞不到足够的芯片,那些宏大的 AI 蓝图恐怕得打折扣
3天前
免费 AI 工具箱 · 全部完全免费