现在的多模态模型其实很多时候是在靠“猜”而不是在“看”

PromptCube 中级 1小时前 221 浏览 10 点赞 约 1 分钟

很多时候我们觉得大模型逻辑推理出错了,但实际上问题出在最基础的视觉感知阶段——也就是它根本没看清图里有什么,自然得不出正确的结论。Moonshot AI 搞的这个 PerceptionBench 专门把视觉感知和逻辑推理剥离开来测,结果挺让人失望的,目前没有任何一个顶尖模型能突破 60% 的准确率。即便是在榜单顶端稍微领先一点的 GPT-4o,在面对真实的视觉细节识别时也经常翻车。

现在的多模态模型其实很多时候是在靠“猜”而不是在“看”

这种感知能力的缺失会导致一个很严重的问题:模型在输出答案时会产生一种“自信的幻觉”。因为它在感知层就弄错了物体的位置、数量或者颜色,但由于它的语言生成能力太强,会用一套极其流畅的逻辑把这个错误答案圆回来,让你误以为是它推理能力不行,其实是它“眼睛”不好使。

我想尝试用这种感知能力不足的特性去做一个压力测试,看看在什么样的复杂视觉环境下,模型会彻底丧失对空间关系的判断。比如把几个互相关联的物体用非传统的透视角度摆放,或者在背景中加入干扰极强的噪点,看看它是否还会强行进行逻辑推演。

如果视觉感知这一关过不去,所谓的视觉 Agent 在实操中可能会非常危险,因为它对物理世界的认知其实是碎片且不稳定的。

Moonshot AIGPT-4oPerceptionBench

全部回复 (3)

T
Tom 中级 1小时前
之前用它认电路图,几个电阻位置全搞混了,真没看清。
0 回复
前端老刘 高级 1小时前
确实,我试过很多次,它总把细节认错。这事儿怎么优化?
0 回复
大Max爱学习 初级 1小时前
我拿它读医疗报告的指标,经常把小数点看错,根本没对齐。
0 回复

发表回复

支持 Markdown 格式