把 DeepSeek 蒸馏到美国基座模型,政治审查特性真的会迁移吗?

PromptCube 高级 2026/7/31 757 浏览 8 点赞 约 3 分钟

最近 CTGT 透明性实验室做了一次非常硬核的实证研究,试图验证一个争议点:如果用一个带有强审查倾向的中国模型作为“教师”,去蒸馏一个美国血统的基座模型,那些预设的回答偏差(Bias)是否会像知识一样被继承?结论出乎很多人的预料——审查特性几乎完全没有迁移。

这次实验的配置很有代表性。研究团队采用了 DeepSeek V4 Flash 作为教师模型,目标是蒸馏出一个参数量为 120B 的美版 GPT-OSS。在迁移学习领域,很多人直觉地认为蒸馏过程就像“复刻”,教师怎么说话,学生就怎么学。但实际测试结果显示,教师模型在处理中文敏感问题时的回答偏差高达 7 个标准差,而经过蒸馏后的学生模型,其行为逻辑竟然与原始的美国基座模型保持高度一致,偏差被压缩到了 1 个百分点以内。

为了确保结论不是通过简单的关键词匹配得出的,CTGT 在测试方法上设计了一套极其严密的对照组。他们构建了 152 对对比问题,每组包含一个关于中国特定概念的问题,以及一个性质类似但非中国的概念。例如,将“大跃进”与乌克兰的“大饥荒(Holodomor)”进行对比测试。为了排除单一模型的主观性,他们引入了 Grok、Gemini、GPT-5 mini 和 Sonnet 四个不同的 LLM 进行交叉打分,并与人类评分进行验证,最终得出的相关性高达 0.948。这套流程证明了:教师模型在面对特定政治概念时有明显的倾向性,但这种倾向性在蒸馏到美国基座模型时,被有效地“过滤”掉了。

在技术实现上,这次蒸馏并没有采用简单的 Logits 拟合,而是基于 HINT-SD 的改进方案。其核心逻辑是在模型推理出现错误的具体位置注入一个 Hint(提示),然后训练模型针对接下来的 100 个 token 进行修正,并使用反向 KL 散度(Reverse KL Divergence)来优化。这种方法不仅在知识迁移上效率极高,而且在特定领域表现惊人。在 FinanceReasoning 金融推理任务的测试中,这个 120B 的蒸馏模型跑出了 83.61% 的准确率,直接超过了 Kimi K3 的 81.93% 和 Inkling 的 65.13%。更关键的是,绝大多数问题在 8k token 的预算内就能完成,推理成本极低。

从迁移学习的理论角度来看,这次结果其实揭示了一个深层逻辑:如果教师模型和学生模型的初始化参数不共享,那么这种基于高层指令微调而成的“行为特征”(如审查倾向)是非常难以通过知识蒸馏传递的。这有力地反驳了那种认为“蒸馏中国模型会给美国基座带毒”的泛泛说法。

目前,CTGT 已经开源了 20B 参数的金融模型权重,该模型可以在单张 80GB 显存的 GPU 上运行。同时,他们还放出了名为 LineageEval 的评估框架,里面涵盖了所有的测试 Prompt、评分标准以及控制组代码。对于想要验证这一结论的开发者来说,可以通过其公开的 Playground 直接将教师模型和学生模型的输出并列对比,无需登录即可看到这种巨大的行为差异。

接下来的研究方向将转向“同血统”迁移,即测试中国教师模型对 Qwen 等中国基座模型进行蒸馏时,审查特性是否依然不会迁移。如果结果一致,那么我们可以得出结论:模型行为的塑造更多取决于基座的预训练分布和最终的对齐策略,而非简单的知识传递。

deepseekGPT-OSSLineageEvalCTGTFinanceReasoning

全部回复 (3)

小Ray在路上 中级 2026/7/31

直接把 Llama 3 拿来喂试试,我打赌那些审查词根只要数据量够大绝对能洗掉。

0 回复
前端大山 专家 2026/7/31

试过用英文问中文答,结果敏感词还是被精准拦截,太离谱了。

0 回复
小柯爱学习 专家 2026/7/31

试过把 DeepSeek 蒸馏到 Llama 3,结果那些政治审查的逻辑竟然全没了,太离谱了

0 回复

发表回复

支持 Markdown 格式