机器学习统计学:从MLE到KL散度
很多大模型底层原理其实就是统计学在打地基,尤其是最大似然估计(MLE)这块,如果没搞清楚,看很多论文里的损失函数推导就像在看天书。
如果觉得数学推导太枯燥,可以找一些实操教程通过代码模拟分布。这里分享一个讲解比较清晰的视频参考:
下一篇
AVIF vs WebP vs JPEG:实测结论 →
最近在补统计基础,发现把 MLE 和 KL 散度(KL Divergence)串起来看才真正明白模型拟合的逻辑。简单来说,我们通过 MLE 来估计参数,而 KL 散度则给出了衡量两个分布之间差异的量化标准,这直接决定了模型是如何在训练过程中“逼近”真实分布的。
对于想从入门到进阶的开发者,建议重点关注以下几个知识点:
- 最大似然估计 (MLE): 核心在于寻找一组参数,使得观测到的数据出现概率最大。
- KL 散度: 理解它如何定义概率分布的距离,这是理解交叉熵损失函数的关键。
- 参数估计: 尝试将上述理论应用到具体的概率分布中,看看参数是如何被推导出来的。
如果觉得数学推导太枯燥,可以找一些实操教程通过代码模拟分布。这里分享一个讲解比较清晰的视频参考:
https://youtu.be/MwTeQVVYtOc?si=UxNOGtqopzJppXAT