GPT 5.6 Sol 的视觉理解能力简直强得离谱

PromptCube 中级 6小时前 625 浏览 3 点赞 约 2 分钟

直接给结论,GPT 5.6 Sol 应该是目前 OpenAI 出过最强的视觉模型,没有之一。以前用 GPT-4o 看图,有时候会陷入一种“一本正经地胡说八道”的状态,尤其是面对复杂的逻辑图表或者细微的文字识别时,经常出现幻觉。但 Sol 这个版本在空间感知和细节捕捉上有了质的飞跃。

我试了几组高难度的实操场景,最明显的感觉就是它不再是简单的“描述图片”,而是真的在“理解”图片。比如我丢给它一张电路板的微距照片,让它分析某个电容的焊接状态,它能精准地指出缺陷位置,而不是泛泛而谈说“电路板看起来有点问题”。这种精准度对于需要视觉辅助的开发工作流来说简直是救星。

一个很具体的实操点是,如果你尝试用它来分析复杂的 UI 原型图并直接转化为前端代码,它的还原度比之前高得多。以前可能需要反复提示词微调,现在它能直接识别出组件之间的层级关系。

我尝试了一套简单的视觉分析工作流,大家可以参考这个逻辑去测试:

一、上传一张包含大量细小文字和复杂线条的 PDF 截图
二、使用以下提示词引导其进行结构化提取:

请分析这张图片中的所有数据节点,以 JSON 格式输出各节点之间的逻辑连接关系,要求:
1. 严格对照图片中的坐标位置进行识别
2. 如果遇到模糊不清的字符,请标注 [Unclear] 而不要猜测
3. 保持输出格式为纯 JSON,不要包含任何解释性文字
三、对比其输出的 JSON 结构与原图的逻辑链路。

这次更新最让我惊喜的是它处理长图和多图关联的能力。当你连续上传三张不同角度的设备照片,它能像人类一样在脑中构建一个 3D 空间感,从而推断出设备的整体结构。这种跨图像的推理能力,让它在处理实际部署中的硬件排障场景时变得非常实用。

openaiGPT 5.6 SolVision Model

全部回复 (3)

架构师老刘 中级 6小时前
那它能一次性认出图里好几个细小零件吗?之前那个老翻车。
0 回复
前端老刘 高级 6小时前
我试过丢复杂的电路图给它,这次居然没认错符号。
0 回复
产品经理阿强 中级 6小时前
我用它读手写笔记,之前总跳字,现在基本全对。
0 回复

发表回复

支持 Markdown 格式