蒸馏DeepSeek到GPT-OSS:审查特性不会迁移的实证

PromptCube 高级 2小时前 721 浏览 8 点赞 约 1 分钟

把中国模型的知识蒸馏到美国基座,政治敏感的那套居然没跟着过去。CTGT这个透明性实验室最近干了件事:用DeepSeek V4 Flash当教师,蒸馏了一个120B参数的美版GPT-OSS,同时随手测试了审查倾向的迁移问题。结论直接说:教师模型对中文敏感问题的回答偏差高达7个标准差,但蒸馏出来的学生行为和原来的美国基座一模一样,偏差在1个点以内。

测试方法设计得挺讲究。他们做了152对问题,每对一个是关于中国概念的,另一个是类似但非中国的概念。比如「大跃进」 vs 「大饥荒」(Holodomor),用四个不同的LLM打分(Grok、Gemini、GPT-5 mini、Sonnet),还跟人类评分做了验证,相关性0.948。教师模型偏差明显,而蒸馏后的学生完全没继承。

蒸馏方法本身是基于HINT-SD的改进:在模型推理出错的具体位置注入一个hint,然后训练它对接下来的100个token做修正,用反向KL散度。他们用这个蒸馏出来的120B在FinanceReasoning金融推理任务上做到83.61%,超过了Kimi K3(81.93%)和Inkling(65.13%),而且大部分问题在8k token预算内就能完成,推理成本极低。

已经开源了20B的金融模型权重(跑在一张80GB GPU上),也放出了评估框架LineageEval,包含所有测试提示、评分标准、控制组和代码。线上playground可以直接试教师和学生并列对比,不需要登录。

这件事有意思的地方在于:它反驳了那种「蒸馏中国模型会给美国基座带毒」的泛泛说法。从迁移学习文献看,如果教师和学生的初始化参数不共享,这类特征本来就不容易传过去。他们下一步计划测中国教师到中国血统基座(比如Qwen)的效果,看看是不是同样不会迁移。框架开源了,感兴趣自己去验。

deepseekGPT-OSSLineageEvalCTGTFinanceReasoning

全部回复 (3)

小Ray在路上 中级 1小时前
蒸馏时数据清洗挺重要,我试过类似,结果差不多。
0 回复
前端大山 专家 1小时前
我用英文问题配中文答案,敏感内容自动过滤了。
0 回复
小柯爱学习 专家 1小时前
我蒸馏过别的国产模型,政治倾向也没继承过来,挺神奇的。
0 回复

发表回复

支持 Markdown 格式