GPT 5.6 Sol 的视觉理解能力简直强得离谱
直接给结论,GPT 5.6 Sol 应该是目前 OpenAI 出过最强的视觉模型,没有之一。以前用 GPT-4o 看图,有时候会陷入一种“一本正经地胡说八道”的状态,尤其是面对复杂的逻辑图表或者细微的文字识别时,经常出现幻觉。但 Sol 这个版本在空间感知和细节捕捉上有了质的飞跃。
我试了几组高难度的实操场景,最明显的感觉就是它不再是简单的“描述图片”,而是真的在“理解”图片。比如我丢给它一张电路板的微距照片,让它分析某个电容的焊接状态,它能精准地指出缺陷位置,而不是泛泛而谈说“电路板看起来有点问题”。这种精准度对于需要视觉辅助的开发工作流来说简直是救星。
一个很具体的实操点是,如果你尝试用它来分析复杂的 UI 原型图并直接转化为前端代码,它的还原度比之前高得多。以前可能需要反复提示词微调,现在它能直接识别出组件之间的层级关系。
我尝试了一套简单的视觉分析工作流,大家可以参考这个逻辑去测试:
一、上传一张包含大量细小文字和复杂线条的 PDF 截图
二、使用以下提示词引导其进行结构化提取:
请分析这张图片中的所有数据节点,以 JSON 格式输出各节点之间的逻辑连接关系,要求:
1. 严格对照图片中的坐标位置进行识别
2. 如果遇到模糊不清的字符,请标注 [Unclear] 而不要猜测
3. 保持输出格式为纯 JSON,不要包含任何解释性文字三、对比其输出的 JSON 结构与原图的逻辑链路。这次更新最让我惊喜的是它处理长图和多图关联的能力。当你连续上传三张不同角度的设备照片,它能像人类一样在脑中构建一个 3D 空间感,从而推断出设备的整体结构。这种跨图像的推理能力,让它在处理实际部署中的硬件排障场景时变得非常实用。
事件追踪 · 相关报道
OpenAI 拿球体填充问题刷屏其实是在秀数学功底
3小时前
英伟达突然砍掉给 OpenAI 的基础设施融资担保额度是不是在传递信
17小时前
年轻人对 AI 公司 CEO 的厌恶程度已经到了让人觉得不可思议的地
20小时前
OpenAI 把专门盯着灾难性风险的团队给解散了
1天前
OpenAI 核心人才接连离职在 IPO 前夕是不是个危险信号
1天前
硅谷大佬们最近疯狂发 AI 宣言其实是在给资本市场打预防针
1天前
免费 AI 工具箱 · 全部完全免费