混淆矩阵:为什么 90% 的准确率可能是个巨大的陷阱
把模型准确率(Accuracy)当成唯一指标,在处理样本不均衡的数据集时简直是灾难。举个极端的医疗场景:如果 100 个人里只有 1 个病人,模型只要无脑预测所有人都是“健康”,准确率直接刷到 99%,但这个模型在医学上完全是废品,因为它漏掉了唯一的病人。
实际分析时,建议直接把预测结果和真实标签拉出来对比,手动算一下这个逻辑:
下一篇
KV Cache 才是大模型推理能跑起来的底层逻辑 →
要真正评估大模型或分类器的实战效果,得盯着混淆矩阵里的这几个核心指标看:
- Precision(精确率): 预测为正样本的人里,真正是正样本的比例。如果你追求的是“宁缺毋滥”,就得提高这个值。
- Recall(召回率): 真正的正样本里,被你成功揪出来的比例。在医疗筛查或金融风控中,这个指标比准确率重要得多,因为漏诊/漏检的代价太高。
- F1 Score: 前两者的调和平均数。当你不知道该偏向精确率还是召回率,或者想用一个综合数值来衡量模型稳健性时,直接看 F1。
实际分析时,建议直接把预测结果和真实标签拉出来对比,手动算一下这个逻辑:
Precision = TP / (TP + FP)
Recall = TP / (TP + FN)
F1 = 2 * (Precision * Recall) / (Precision + Recall)(注:TP=真阳性, FP=假阳性, FN=假阴性)
很多新手在做 AI Agent 的评估或者微调模型后,习惯性地只报一个 Accuracy,这在技术评审里很容易被质疑。建议在报告里直接贴出混淆矩阵的数值分布,这样一眼就能看出模型到底是倾向于“过度预测”还是“习惯性漏掉”。
