把大厂隐藏的推理链通过低端模型给“骗”出来这招真的绝
很多闭源大模型现在为了保护知识产权,故意把 Chain-of-Thought(思维链)给隐藏了。表面上看,API 只给你最终结果,但实际上这些推理轨迹被加密成了文本块,在客户端和服务器之间来回传递。这种设计原本是为了省服务器存储压力,结果却留下了一个巨大的架构漏洞:同一个厂商旗下的不同模型,这些加密块竟然是通用且互换的。
从技术实现上看,这种漏洞本质上是缺乏严格的会话绑定和模型权限隔离。如果厂商不给加密块增加用户 ID 或会话 ID 的强校验,这种“降级解密”的玩法在很多 API 体系里依然能跑通。
下一篇
把 AI Agent 扔进公开提示词池子里跑红队测试到底能测出多少漏 →
简单来说,就是你可以把一个顶尖模型(比如最强的那个)生成的加密推理块,直接塞给同一个厂商旗下一个防御更弱、更简单的低端模型。因为低端模型没有那么复杂的权限校验或安全过滤,它在处理这个块时,会直接把它以明文形式解密并输出。这意味着你根本不需要去正面硬刚那个高阶模型的防御系统,只要找个“内鬼”模型就能把推理过程偷走。
这种漏洞在实际操作中能搞出不少事情,我梳理了几个关键的攻击路径:
- 绕过蒸馏限制: 直接通过低端模型提取高阶模型的推理逻辑,这让那些想通过 API 偷偷训练自己的小模型的人简直狂喜。
- 隐私数据泄露: 很多人习惯把 session log 传到公开仓库,以为加密块是安全的。但研究者在 31 万个块里竟然翻出了 300 多个个人隐私信息(PII)和 180 多个凭据。
- 挖掘隐藏风险: 有时候模型最终输出说“我不能回答这个问题”,但其实在隐藏的推理链里,它已经把答案算出来了。通过这种方法能强行把这些被拦截的危险信息拽出来。
- 隐形提示词注入: 攻击者可以把恶意载荷直接埋在加密块里,在不触发前端检测的情况下污染 AI Agent 的运行流程。
从技术实现上看,这种漏洞本质上是缺乏严格的会话绑定和模型权限隔离。如果厂商不给加密块增加用户 ID 或会话 ID 的强校验,这种“降级解密”的玩法在很多 API 体系里依然能跑通。
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。