计算机视觉的演进史:模型到底把“知识”存哪了?

CameronOwl 专家 1天前 49 浏览 12 点赞 约 2 分钟

从2001年那个在Pentium III上跑15fps的脸部检测器,到现在的SAM 3能通过一句“黄色校车”就精准抠图,视觉模型在25年间完成的不是简单的算力升级,而是“知识存储位置”的根本性迁移。

把这个演进过程拆解开看,其实就是一套关于“谁在定义特征”的权力交接史:

一、手动定义特征时代(工程师的大脑)
在深度学习霸权之前,视觉模型的“知识”其实存储在开发者的脑子里。工程师得手动写代码定义什么是边缘、什么是角点、什么是对比度模式。

  • 核心逻辑: 像素 → 人工设计的特征 → 分类器。
  • 代表作: Canny边缘检测、Harris角点检测,以及著名的Viola-Jones人脸检测。
计算机视觉的演进史:模型到底把“知识”存哪了?
这个时期的一个残酷教训是:如果前端特征提取时把某些信息丢了,后面的分类器无论怎么优化都找不回来。这意味着工程师必须在设计之初就预判好尺度、旋转和光照的鲁棒性。

二、卷积神经网络时代(权重的分布)
随着CNN的崛起,知识从代码变成了权重。模型不再依赖工程师告诉它“圆圈长什么样”,而是在海量标注数据中通过反向传播自己学习卷积核。

  • 核心逻辑: 像素 → 可学习的卷积层 → 语义特征 → 分类。
这时候,知识被编码在数百万个参数的权重分布中。虽然我们能可视化前几层在看边缘,后几层在看物体部件,但这种知识是“碎片化”且难以通过人类语言直接干预的。

计算机视觉的演进史:模型到底把“知识”存哪了?

三、大模型与多模态时代(预训练的表征空间)
到了现在的Foundation Model阶段,知识被存储在了一个巨大的、跨模态的表征空间里。像素不再仅仅被映射为类别,而是被映射为与语言对齐的向量。

  • 核心逻辑: 像素 → 预训练视觉编码器 → 语言提示词(Prompt)引导 → 实例掩码/描述。
像SAM 3这类模型,其知识是通用的。它不需要为每个物体单独训练,而是利用预训练阶段建立的视觉-语言联系,通过提示词在潜空间中定位目标。

从实战角度看,这种迁移改变了我们的开发模式。以前调优是改数学公式或特征算子,后来是调超参数和网络架构,现在则是写Prompt或进行微调(Fine-tuning)。但无论存储位置怎么变,数据质量和几何一致性这些底层坑依然存在。

大模型LLMmachinelearningdeeplearningcomputervision

全部回复 (3)

前端大山 专家 1天前
以前得手动调各种算子,现在直接跑个预训练模型就搞定了。
0 回复
创业者阿杰 中级 1天前
那现在的模型在推理时,能具体定位到哪层权重在起作用吗?
0 回复
折腾党小雨 中级 1天前
早年搞HOG特征得熬夜调参数,现在基本都靠权重空间表征了。
0 回复

发表回复

支持 Markdown 格式