大模型训练到底是喂现成数据好,还是让它自己跟自己玩比较强?
最近在看关于 LLM 后训练(Post-training)的底层逻辑,发现很多人在讨论 RLHF、PPO 或者合成数据(Synthetic Data)的时候,其实都在绕不开一个非常经典但又极其关键的概念:On-Policy(同策)和 Off-Policy(异策)的学习差异。这玩意儿听起来像是上世纪 90 年代强化学习的老古董,但在现在大模型卷逻辑推理、卷自我进化的时候,这才是决定模型上限的核心。
下一篇
项目按时交付了,客户却还是想解约?这事儿真不奇怪 →
很多人以为这只是“在线训练”和“离线训练”的区别,其实没那么简单。最核心的判断标准在于:模型现在学习的数据,到底是不是它自己当前这个状态下能产出的行为?
我用写 Python 代码这个场景来拆解一下,大家一下就能听懂:
- On-Policy(同策)模式:
- Off-Policy(异策)模式:
这里有个很微妙的博弈点。
如果用 Off-Policy(喂题库),优点是极其高效。你可以直接把人类或更强模型的精华喂给它,它能快速学会那些它自己根本想不出来的正确逻辑。但缺点也显而易见:如果题库里全是它自己永远也跨不过去的思维陷阱,它就永远学不会。
而 On-Policy 的逻辑更硬核,也更接近所谓的“自我进化”。模型在自己的错误边界上反复横跳,通过不断尝试(Exploration)和反馈(Feedback)来修正自己。这种方式虽然对算力和采样效率的要求极高,但它能解决一个致命问题:弥补训练数据与实际推理分布之间的鸿沟(Distribution Shift)。
现在的技术趋势,比如通过强化学习让模型生成自己的训练轨迹(Training Trajectories),本质上就是在往 On-Policy 的方向走。只有当模型能从“自己犯的错”里学到东西,而不是仅仅死记硬背“别人写对的代码”时,它才真正具备了逻辑推理的闭环能力。
免费 AI 工具箱 · 全部完全免费
更多可复用的提示词工作流收录在ChatGPT提示词优化指南,有不少直接可参考的案例。
