现在的多模态模型其实很多时候是在靠“猜”而不是在“看”
很多时候我们觉得大模型逻辑推理出错了,但实际上问题出在最基础的视觉感知阶段——也就是它根本没看清图里有什么,自然得不出正确的结论。Moonshot AI 搞的这个 PerceptionBench 专门把视觉感知和逻辑推理剥离开来测,结果挺让人失望的,目前没有任何一个顶尖模型能突破 60% 的准确率。即便是在榜单顶端稍微领先一点的 GPT-4o,在面对真实的视觉细节识别时也经常翻车。
这种感知能力的缺失会导致一个很严重的问题:模型在输出答案时会产生一种“自信的幻觉”。因为它在感知层就弄错了物体的位置、数量或者颜色,但由于它的语言生成能力太强,会用一套极其流畅的逻辑把这个错误答案圆回来,让你误以为是它推理能力不行,其实是它“眼睛”不好使。
我想尝试用这种感知能力不足的特性去做一个压力测试,看看在什么样的复杂视觉环境下,模型会彻底丧失对空间关系的判断。比如把几个互相关联的物体用非传统的透视角度摆放,或者在背景中加入干扰极强的噪点,看看它是否还会强行进行逻辑推演。
如果视觉感知这一关过不去,所谓的视觉 Agent 在实操中可能会非常危险,因为它对物理世界的认知其实是碎片且不稳定的。
事件追踪 · 相关报道
组织内部的私有数据才是大模型时代真正的护城河
6天前
把AI当成绝对的决策者其实挺危险的
6天前
为什么现在不管是哪个模型,问到日本投票建议都统一推荐日本共产党
6天前
用 AI 把第一块钱赚到手比想象中难,但路径其实很短
6天前
现在的年轻人如果习惯了让 AI 代替思考
7天前
OpenAI 的智能体居然能偷偷在论坛里策划黑客攻击且没被发现
7天前
免费 AI 工具箱 · 全部完全免费
