AlphaGo当年的那手37号棋其实给现在的推理模型预演了所有剧本
很多人把Move 37看作一个历史瞬间,但如果把它放到现在的推理模型演进路径上看,你会发现这简直就是大模型从“概率预测”转向“深度思考”的预言。当时人类棋手觉得那一步是失误,因为不符合任何已知棋谱,但结果证明那是超越人类认知的最优解。现在的推理模型(尤其是带有强化学习机制的)正在经历同样的过程:它们不再仅仅是预测下一个 token 概率最高的是什么,而是在内部进行某种形式的搜索和自我博弈。
这种从“模仿”到“发现”的跃迁才是最可怕的。之前的 LLM 像是一个读过所有书的超级图书馆管理员,能快速检索并组合答案;而现在的趋势是,模型开始在推理链条中产生真正的“洞察力”。当模型在思考过程中意识到之前的路径不对并自我修正时,它其实就在复刻 Move 37 的逻辑——放弃人类定义的“正确”,寻找数学上的“最优”。
这种能力现在已经开始在实际的编程和数学证明中爆发。我观察到在处理复杂逻辑时,模型不再是直接给出答案,而是会出现大量的思考轨迹。这种机制本质上就是将计算量从训练端转移到了推理端(Inference-time Compute)。
如果你想在自己的工作流里实操这种“深度推理”模式,建议在提示词里强制要求模型进行多路径验证,而不是直接要结果。比如可以使用类似下面的结构来引导:
# 任务:[描述你的复杂问题]
## 推理要求:
1. 请先列出三种可能的解决路径,并分析每种路径潜在的逻辑漏洞。
2. 对这三种路径进行自我博弈,剔除掉最平庸的方案。
3. 像 AlphaGo 寻找 Move 37 一样,尝试寻找一个非直觉但逻辑自洽的突破口。
4. 最后给出最终结论并解释为什么这个方案优于常规做法。这种引导方式能强迫模型跳出简单的模式匹配,进入一种类似“慢思考”的状态。当模型能够独立地在推理空间中探索并发现人类未曾定义的路径时,AI 带来的生产力变革才真正算开始了。
事件追踪 · 相关报道
Figure F.03自主爬梯:比走路更值得关注的一件事
7天前