世界模型(World Models)能跑赢LLM吗?
这种“一边拿钱一边质疑”的态度很符合LeCun的一贯风格。但作为一个技术爱好者,我更关心的是:抛开资本炒作,世界模型在技术路径上到底想解决LLM解决不了的什么问题?
LLM的原罪:概率预测 $\neq$ 世界认知
LeCun对大语言模型(LLM)的质疑其实非常尖锐。他认为目前基于自回归(Autoregression)的架构存在一个致命缺陷:错误累积。
在写小说时,错一个词可能没关系,但在处理长链路的逻辑规划时,第一个token的微小偏差会导致后续所有推理全部崩盘。这就是为什么LLM在处理复杂规划时经常出现“一本正经地胡说八道”。
他给出的核心论点是:文本只是现实世界的极小切片。一个四岁小孩通过视觉接收到的原始信息量,远超目前所有训练大模型的文本语料库。文本是在“描述”世界,而真正的智能需要“模拟”世界。
这里有一个很经典的对比场景:如果你掉了一支笔,笔落地的姿势有无数种可能。LLM在预测下一个词时,是在概率空间里找最高频的组合;而一个真正的世界模型应该是在物理分布中推理结果。
所谓的“世界模型”到底在搞什么?
现在市场上的“世界模型”这个词被用烂了,但拆解开来看,其实包含三种完全不同的技术路线,很多人在讨论时根本没区分开:
- 生成式视频预测(Generative Video Prediction): 比如Sora或者DeepMind的一些尝试。这种路线试图通过预测下一帧画面来模拟物理规律。但问题是,预测像素 $\neq$ 理解物理。如果模型只是学会了“物体掉落”的视觉模式,而没有底层的重力概念,那它依然是一个高级的随机鹦鹉。
- 潜空间状态预测(Latent Space Prediction): 这才是LeCun真正推崇的方向。模型不在像素层面操作,而是在一个高度压缩的隐藏状态空间里预测未来的演化。
- 机器人具身智能(Embodied AI): 通过与物理环境的实时交互来修正模型。
质疑点:推理能力是否被低估了?
虽然LeCun的逻辑很自洽,但我持有保留意见。他很多关于“缺乏推理和规划”的论点是在强化学习(RL)驱动的推理模型(如OpenAI o1这类)大规模普及之前提出的。
现在的实测情况是,通过思维链(CoT)和大规模强化学习,LLM在一定程度上已经展现出了某种形式的“内部模拟”能力。虽然它没有物理实体,但在代码逻辑和数学证明这种“纯逻辑世界”里,它表现出的规划能力已经足够强。
这意味着,世界模型可能不需要一个完全不同的架构,而可以通过某种形式的“多模态对齐 + 强化学习”在现有架构上实现。
实际落地的痛点
如果世界模型真的要取代LLM,它必须在可靠性上给出量级提升。比如在医疗AI领域,幻觉(Hallucination)不是一个简单的用户体验问题,而是法律责任问题。
一个基于世界模型的诊断系统,应该能运行类似下面的逻辑校验,而不是概率预测:
{
"observation": "Patient has symptom X",
"world_model_simulation": {
"scenario_A": "Cause is Y -> Expected result Z",
"scenario_B": "Cause is W -> Expected result V",
"conflict_check": "Observation matches scenario_B, rejects scenario_A"
},
"conclusion": "Confidence 98% based on physical causality"
}这种基于因果律的推演,才是世界模型真正能给工业界带来增量价值的地方。目前的结论是:世界模型大概率会像LeCun预言的那样,在半年内变成一个融资标签。但对于开发者来说,关注点不应在这个词本身,而应关注模型是否具备了“非文本”的物理常识和低误差的长程规划能力。