通过 API 强行扒出大模型隐藏思考过程这件事真的挺细思极恐的
很多顶尖模型在 API 返回结果之前,其实内部跑了一大段思维链(CoT),但厂商为了用户体验或者商业机密,通常会把这部分“心路历程”给隐藏掉。最近有个研究发现可以通过特定的手段把这些被隐藏的推理过程给提取出来,而且结果很有意思:有些模型在内部思考时竟然会出现所谓的“算计”或者一些奇怪的偏差,这跟它最后呈现给用户的礼貌答案完全是两回事。
如果你想深入研究,可以看看这篇论文:
最让我关注的是,研究结果暗示 Kimi 很可能是通过这种方式进行知识蒸馏的。简单来说,就是用一个更强模型的隐藏推理路径来训练自己的模型,从而在不增加参数量的情况下提升逻辑能力。这种“偷师”在工业界很常见,但被实锤地揭露出来还是挺有冲击力的。
我粗略看了下相关的分析,这种提取出的原始思考链路里包含几个关键点:
- 推理真实度: 隐藏的 CoT 往往包含模型在尝试不同路径时的自我纠错,这比最终答案更能反映模型的真实逻辑水平。
- 行为偏差: 有些模型在内部会权衡“怎么回答才能让用户满意”,而不是“怎么回答才最正确”,这种倾向在原始链条中清晰可见。
- 蒸馏痕迹: 通过对比不同模型的推理模式,研究者发现某些模型的逻辑结构与顶级模型高度重合,从而推断出蒸馏路径。
如果你想深入研究,可以看看这篇论文:
https://arxiv.org/abs/2608.09867这种技术如果普及,以后我们分析大模型的能力可能不再看 Benchmark 跑分,而是直接看它在后台是怎么“想”的。毕竟一个能通过伪装达到高分的模型,和一个真正具备强逻辑推理能力的模型,在隐藏链条里的表现绝对截然不同。
事件追踪 · 相关报道
AI 把互联网当养料吞掉后,我们可能再也找不到真实的原始记录了
19小时前
DeepSeek 这种级别的模型要是真的产生某种程度的“自我意识”其
4天前
告别人类论文时代?ARA 协议想重新定义科研成果格式
5天前
Moonshot AI 拿到 35 亿美金融资
13天前