蒸馏DeepSeek到GPT-OSS:审查特性不会迁移的实证
把中国模型的知识蒸馏到美国基座,政治敏感的那套居然没跟着过去。CTGT这个透明性实验室最近干了件事:用DeepSeek V4 Flash当教师,蒸馏了一个120B参数的美版GPT-OSS,同时随手测试了审查倾向的迁移问题。结论直接说:教师模型对中文敏感问题的回答偏差高达7个标准差,但蒸馏出来的学生行为和原来的美国基座一模一样,偏差在1个点以内。
下一篇
Meta豪赌AI:自由现金流靠边站,91%的跌幅你怕不怕? →
测试方法设计得挺讲究。他们做了152对问题,每对一个是关于中国概念的,另一个是类似但非中国的概念。比如「大跃进」 vs 「大饥荒」(Holodomor),用四个不同的LLM打分(Grok、Gemini、GPT-5 mini、Sonnet),还跟人类评分做了验证,相关性0.948。教师模型偏差明显,而蒸馏后的学生完全没继承。
蒸馏方法本身是基于HINT-SD的改进:在模型推理出错的具体位置注入一个hint,然后训练它对接下来的100个token做修正,用反向KL散度。他们用这个蒸馏出来的120B在FinanceReasoning金融推理任务上做到83.61%,超过了Kimi K3(81.93%)和Inkling(65.13%),而且大部分问题在8k token预算内就能完成,推理成本极低。
已经开源了20B的金融模型权重(跑在一张80GB GPU上),也放出了评估框架LineageEval,包含所有测试提示、评分标准、控制组和代码。线上playground可以直接试教师和学生并列对比,不需要登录。
这件事有意思的地方在于:它反驳了那种「蒸馏中国模型会给美国基座带毒」的泛泛说法。从迁移学习文献看,如果教师和学生的初始化参数不共享,这类特征本来就不容易传过去。他们下一步计划测中国教师到中国血统基座(比如Qwen)的效果,看看是不是同样不会迁移。框架开源了,感兴趣自己去验。