计算机视觉的演进史:模型到底把“知识”存哪了?
从2001年那个在Pentium III上跑15fps的脸部检测器,到现在的SAM 3能通过一句“黄色校车”就精准抠图,视觉模型在25年间完成的不是简单的算力升级,而是“知识存储位置”的根本性迁移。
下一篇
Apple Silicon跑大模型到底能跑多快? →
把这个演进过程拆解开看,其实就是一套关于“谁在定义特征”的权力交接史:
一、手动定义特征时代(工程师的大脑)
在深度学习霸权之前,视觉模型的“知识”其实存储在开发者的脑子里。工程师得手动写代码定义什么是边缘、什么是角点、什么是对比度模式。
- 核心逻辑: 像素 → 人工设计的特征 → 分类器。
- 代表作: Canny边缘检测、Harris角点检测,以及著名的Viola-Jones人脸检测。
二、卷积神经网络时代(权重的分布)
随着CNN的崛起,知识从代码变成了权重。模型不再依赖工程师告诉它“圆圈长什么样”,而是在海量标注数据中通过反向传播自己学习卷积核。
- 核心逻辑: 像素 → 可学习的卷积层 → 语义特征 → 分类。

三、大模型与多模态时代(预训练的表征空间)
到了现在的Foundation Model阶段,知识被存储在了一个巨大的、跨模态的表征空间里。像素不再仅仅被映射为类别,而是被映射为与语言对齐的向量。
- 核心逻辑: 像素 → 预训练视觉编码器 → 语言提示词(Prompt)引导 → 实例掩码/描述。
从实战角度看,这种迁移改变了我们的开发模式。以前调优是改数学公式或特征算子,后来是调超参数和网络架构,现在则是写Prompt或进行微调(Fine-tuning)。但无论存储位置怎么变,数据质量和几何一致性这些底层坑依然存在。
