用 TreeSHAP 解释知识追踪模型时,稳定性到底能不能信

Kevin爱学习 高级 1小时前 62 浏览 14 点赞 约 3 分钟

很多知识追踪(KT)模型在预测学生表现时就像个黑盒,虽然能跑出分数,但很难说清楚为什么预测这个学生会掉坑里。arXiv 2609.28502v1 这篇论文专门在死磕一个问题:这些模型的解释是否稳定且忠实。结论是,如果你用 XGBoost 配合 TreeSHAP,在信息对等的情况下,预测能力和解释的稳定性其实比那些深度学习基准模型要强。

深度模型和 XGBoost 的预测能力差在哪

这篇研究最硬核的地方在于它做了一个信息匹配协议。通常 DKT、SAKT、AKT 和 SimpleKT 这些深度模型被认为更强,但论文发现这其实是因为输入信息的不对等。

研究者在 ASSISTments 2009 和 2012 数据集上工程化了 5 个教学主题的 13 个行为特征。当 XGBoost 被限制在只能使用和深度模型一样的“标识符-正确性”流数据时,两者的表现几乎打平。具体数字如下:

  • 在 2012 数据集上: XGBoost 的 AUC 达到了 0.777,而预测时(剔除当前响应潜伏期后)为 0.771。在限制信息后,它与基准模型的对比是 0.697 对 0.700。
  • 在重建后的 2009 数据集上: XGBoost 的 AUC 是 0.786,预测时为 0.775。限制信息后的对比是 0.717 对 0.720。
这说明预测能力的差距不在于模型家族(深度学习 vs 梯度提升树),而在于喂给模型的信息量。

数据的坑:ASSISTments 2009 的标签泄露

如果你在跑 KT 相关的实验,一定要注意 ASSISTments 2009 那个未修正的 skill-builder 版本。论文里提到一个很关键的坑:在该版本中,每个涉及多技能的交互会被拆分成多行,每行对应一个技能。

由于这些行共享同一个正确性标签,这个标签会泄露到之前的交互特征中,导致模型性能虚高。研究者在重建该数据集后,发现模型的 AUC 实际上降低了,而且解释结果的排序也随之发生了变化。这个细节提醒我们,很多 KT 论文里刷出的高分,可能只是因为数据预处理时的泄露。

解释的稳定性与忠实度怎么验证

为了验证解释是否靠谱,研究者用了三套方案:

一、稳定性测试(Stability): 观察在不同折叠(folds)、不同随机种子和不同条件方案下,特征排名的变化。结果显示 Spearman rho 系数在 0.989 到 1.000 之间,这意味着 TreeSHAP 给出的特征排名极其稳定。

二、忠实度测试(Faithfulness): 采用基于重新训练的验证方法。具体操作是:移除 TreeSHAP 排名最靠前的特征,看 AUC 的下降程度。结果证明,移除高排名特征对 AUC 的伤害远大于随机移除特征,这证明了 TreeSHAP 捕捉到的确实是模型决策的关键点。

三、对比测试: 将 TreeSHAP 与 split-gain(分裂增益)和 permutation(排列重要性)进行对比,发现后两者的表现与 TreeSHAP 相当。

落地到具体操作的思考

这篇论文给出的路径是:如果你需要一个既能预测且能给出可靠解释的 KT 系统,不要盲目追求复杂的深度模型。使用 XGBoost 配合 TreeSHAP 能够提供一个可验证的解释路径。

在实际操作中,可以参考以下逻辑构建特征:

  • 提取 5 个教学主题相关的行为特征。
  • 确保历史特征仅由时间上之前的交互计算得出。
  • 在回顾性分析之外,严格剔除“当前响应潜伏期”这一特征,避免预测时的信息泄露。

最后需要注意,论文明确提到,虽然学生级别的示例可以作为解释参考,但它们属于“说明性解释”,而不是经过验证的教学建议,不能直接作为教学干预的唯一依据。

求助XGBoostTreeSHAPASSISTmentsKnowledge Tracing

全部回复 (1)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

完
完美主义技术宅 专家 1小时前

早知道限制信息后 XGBoost 跑 0.777 这么猛,我就不花一个月时间死磕那个深度模型了,纯纯浪费时间。

0 回复

发表回复

支持 Markdown 格式
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。