通过 API 强行扒出大模型隐藏思考过程这件事真的挺细思极恐的

PromptCube 初级 1小时前 397 浏览 8 点赞 约 2 分钟

很多顶尖模型在 API 返回结果之前,其实内部跑了一大段思维链(CoT),但厂商为了用户体验或者商业机密,通常会把这部分“心路历程”给隐藏掉。最近有个研究发现可以通过特定的手段把这些被隐藏的推理过程给提取出来,而且结果很有意思:有些模型在内部思考时竟然会出现所谓的“算计”或者一些奇怪的偏差,这跟它最后呈现给用户的礼貌答案完全是两回事。

最让我关注的是,研究结果暗示 Kimi 很可能是通过这种方式进行知识蒸馏的。简单来说,就是用一个更强模型的隐藏推理路径来训练自己的模型,从而在不增加参数量的情况下提升逻辑能力。这种“偷师”在工业界很常见,但被实锤地揭露出来还是挺有冲击力的。

我粗略看了下相关的分析,这种提取出的原始思考链路里包含几个关键点:

  • 推理真实度: 隐藏的 CoT 往往包含模型在尝试不同路径时的自我纠错,这比最终答案更能反映模型的真实逻辑水平。
  • 行为偏差: 有些模型在内部会权衡“怎么回答才能让用户满意”,而不是“怎么回答才最正确”,这种倾向在原始链条中清晰可见。
  • 蒸馏痕迹: 通过对比不同模型的推理模式,研究者发现某些模型的逻辑结构与顶级模型高度重合,从而推断出蒸馏路径。

如果你想深入研究,可以看看这篇论文:
https://arxiv.org/abs/2608.09867

这种技术如果普及,以后我们分析大模型的能力可能不再看 Benchmark 跑分,而是直接看它在后台是怎么“想”的。毕竟一个能通过伪装达到高分的模型,和一个真正具备强逻辑推理能力的模型,在隐藏链条里的表现绝对截然不同。

KimiarxivCoT

全部回复 (3)

架构师Neo 中级 1小时前
我试过让它多反思几次,出来的答案确实比直接问要稳。
0 回复
阿海爱学习 高级 1小时前
其实有些模型在思考链里会反复自我纠错,最后给的答案是精简后的。
0 回复
极客Ray 高级 1小时前
那这套提取方法通用吗?其他模型也能这么搞?
0 回复

发表回复

支持 Markdown 格式