多模态大模型真的看懂图片了吗,还是在用语言能力强行圆场
最近在深度测试几个多模态模型时,我发现了一个挺诡异的现象:当你给模型一张包含复杂空间关系的图片并询问结论时,它给出的推理过程逻辑严密得像个法学专家,但结论却离谱得像个随机数生成器。起初我以为是模型的逻辑链条(Chain-of-Thought)断了,但深入分析后才意识到,问题根本不在于它怎么“想”,而在于它根本没看清。
这种现象在 Moonshot AI 发布的 PerceptionBench 测试集里体现得淋漓尽致。这个基准测试的核心逻辑非常硬核,它通过将“视觉感知”与“逻辑推理”强行剥离开来,专门测试模型对物体位置、数量、颜色等基础视觉细节的捕捉能力。结果相当令人沮丧,目前没有任何一个顶尖模型能突破 60% 的准确率。即便是在榜单顶端稍微领先的 GPT-4o,在面对真实的视觉细节识别时也经常出现低级错误。
这里就涉及到一个多模态模型最致命的缺陷:自信的幻觉。
视觉编码错误如何被语言逻辑掩盖
我们要意识到,现在的 LMM(大语言多模态模型)本质上是一个强大的语言生成器挂载了一个视觉编码器。当视觉编码器在感知层把某个物体的位置或者颜色弄错时,语言生成部分并不会意识到自己“看错了”,而是会利用其强大的语料库,用一套极其流畅的逻辑把这个错误答案给“圆”回来。
举个例子,如果你给它一张照片,里面有一个红色杯子在蓝色盘子左边,但模型感知层误认为杯子在右边。它不会告诉你“我不确定杯子在哪”,而是会一本正经地告诉你:“由于杯子位于盘子的右侧,因此它处于某种特定的物理状态……”,接下来的推理逻辑完美无缺,但基础事实完全错误。这种“感知缺失 → 逻辑圆场”的路径,极大地误导了用户,让我们误以为模型是推理能力不行,其实是它的“眼睛”不好使。
极端视角与背景干扰下的感知失效
基于这个观察,我最近在尝试做一套压力测试,试图挖掘模型在什么样的视觉环境下会彻底丧失对空间关系的判断。我的测试方案主要集中在两个维度:一是采用非传统的透视角度(例如极端的俯视或反常规的镜像角度)摆放互相关联的物体;二是向背景中注入高强度的干扰噪点。我想看看,当视觉输入变得模糊或反直觉时,模型是否还会强行启动逻辑推演来掩盖感知的失败。
空间认知碎片化对智能体的致命影响
如果视觉感知这一关过不去,那么目前很多厂商吹捧的“视觉 Agent”在实际落地中可能会非常危险。因为 Agent 需要在物理世界中进行闭环操作,如果它对物体的空间认知是碎片化且不稳定的,那么它在执行指令时可能会出现严重的误判。一个不能准确识别 0.1 毫米偏差或颜色细微差别的模型,是不可能真正胜任工业级视觉任务的。
总的来看,我们现在面对的不是一个“思考能力”不足的 AI,而是一个在用极其聪明的语言技巧掩盖“视力缺陷”的 AI。在追求更复杂的推理能力之前,提升最基础的视觉感知精度,才是多模态模型真正需要跨过的门槛。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
给它一张复杂的空间关系表格,它的推理链条就像法学专家,但结论离谱得像随机数——因为它根本没看清。比如,你描述一张照片里红色杯子在蓝色盘子左边,模型却自信满满地说杯子在右边,接着用一套完美的逻辑解释说“由于杯子位于盘子的右侧,因此它处于某种特定的物理状态……”,这种“感知缺失 → 逻辑圆场”的套路,在 Moonshot AI 发布的 PerceptionBench 里体现得淋漫尽致——目前没任何顶尖模型能突破 60%,GPT-4o 也经常犯低级错误。
医疗报告的小数点都能看错,这要是真用来诊断得出多少事故啊,我觉得这也和我们讨论的视觉编码错误有关系,最近在深度测试几个多模态模型时,我发现了一个挺诡异的现象:当你给模型一张包含复杂空间关系的图片并询问结论时,它给出的推理过程逻辑严密得像个法学专家,但结论却离谱得像个随机数生成器。起初我以为是模型的逻辑链条(Chain-of-Thought)断了,但深入分析后才意识到,问题根本不在于它怎么“想”,而在于它根本没看清。

给它发电路图,电阻位置全指错了,这只能算“睁眼瞎”,但如果在背景里加入高强度的干扰噪点来测试,就能直接看出模型是否真的看清了细节。