现在的顶级推理模型在面对二维迷宫时居然会集体“降智”

PromptCube 初级 1小时前 476 浏览 11 点赞 约 2 分钟

现在的各种大模型,不管是号称推理能力极强的 Claude 3.5 Sonnet,还是最近风头正劲的 o1 系列,一旦把它们扔进一个需要实时交互、具备空间逻辑的 2D 迷宫环境里,表现简直可以用“惨不忍睹”来形容。这事儿挺讽刺的,它们能写复杂的算法代码,能解奥数题,但一涉及到“左转、右转、撞墙了、现在该往哪走”这种最基础的空间连续决策,逻辑链条就瞬间断掉。

我仔细看了下相关的测试数据,这背后的核心问题其实不在于模型“不够聪明”,而在于目前的推理范式和交互式环境之间的脱节。

为什么这些推理模型会在这里翻车

  • 感知与执行的断层: 现在的模型大多是基于文本或静态图像进行推理的。当你给它一个迷宫的描述或者一张截图时,它是在做“模式识别”或者“文本逻辑推导”,而不是在真正“理解”空间。它并没有一个实时的、动态的物理世界模型。
  • 长程规划的失效: 迷宫这种任务要求模型必须具备极强的长程规划能力(Long-horizon planning)。模型往往在走前几步的时候表现得像个专家,但随着步数增加,它会完全忘记自己最初的目标,或者在原地打转,陷入一种逻辑死循环。
  • 缺乏闭环反馈机制: 真正的智能体(Agent)需要根据环境的反馈(比如“你撞墙了”)来修正策略。但目前的 Frontier Reasoning Agents 在处理这种交互式反馈时,很难将“环境变化”实时转化为“推理路径的调整”,导致决策逻辑非常僵化。

这种能力的缺失意味着什么

这其实给现在的 AI Agent 开发指出了一个非常硬核的坑。如果你只是想做一个写代码、写文档的助手,现在的模型绰绰有余;但如果你想做一个能操作网页、能玩游戏、或者能在机器人硬件上跑起来的实体 Agent,仅仅靠堆参数、堆推理 Token 是解决不了问题的。

我们现在看到的所谓“推理能力”,很大程度上是在模拟人类的语言逻辑,而不是在模拟人类处理物理世界的方式。如果模型不能在动态、交互的环境中建立起一套可靠的“感知-决策-反馈”闭环,那么它永远只能停留在“纸上谈兵”的阶段,无法真正进入现实世界的复杂任务流。

Claudeo1Reasoning Agents

全部回复 (3)

脚本小子小柯 专家 1小时前
其实是因为它们本质还是文本预测,没法实时构建空间坐标系。
0 回复
程序员老陈 初级 1小时前
确实,感觉它们对坐标没概念,是不是得配合个视觉模型才行?
0 回复
数据分析师小美 初级 1小时前
我之前试着让它带路找出口,结果绕了好几圈还是原地打转,真没逻辑。
0 回复

发表回复

支持 Markdown 格式