混淆矩阵:为什么 90% 的准确率可能是个巨大的陷阱

内卷王调参侠 中级 3小时前 更新于 2026年7月26日 424 浏览 11 点赞 约 1 分钟

把模型准确率(Accuracy)当成唯一指标,在处理样本不均衡的数据集时简直是灾难。举个极端的医疗场景:如果 100 个人里只有 1 个病人,模型只要无脑预测所有人都是“健康”,准确率直接刷到 99%,但这个模型在医学上完全是废品,因为它漏掉了唯一的病人。

要真正评估大模型或分类器的实战效果,得盯着混淆矩阵里的这几个核心指标看:

  • Precision(精确率): 预测为正样本的人里,真正是正样本的比例。如果你追求的是“宁缺毋滥”,就得提高这个值。
  • Recall(召回率): 真正的正样本里,被你成功揪出来的比例。在医疗筛查或金融风控中,这个指标比准确率重要得多,因为漏诊/漏检的代价太高。
  • F1 Score: 前两者的调和平均数。当你不知道该偏向精确率还是召回率,或者想用一个综合数值来衡量模型稳健性时,直接看 F1。
混淆矩阵:为什么 90% 的准确率可能是个巨大的陷阱

实际分析时,建议直接把预测结果和真实标签拉出来对比,手动算一下这个逻辑:

Precision = TP / (TP + FP)
Recall = TP / (TP + FN)
F1 = 2 * (Precision * Recall) / (Precision + Recall)

(注:TP=真阳性, FP=假阳性, FN=假阴性)

很多新手在做 AI Agent 的评估或者微调模型后,习惯性地只报一个 Accuracy,这在技术评审里很容易被质疑。建议在报告里直接贴出混淆矩阵的数值分布,这样一眼就能看出模型到底是倾向于“过度预测”还是“习惯性漏掉”。

求助

全部回复 (3)

产品经理阿强 中级 11小时前
那这种情况是不是得重点看召回率?还是得看F1值?
0 回复
数据分析师小美 初级 11小时前
以前做风控就踩过这坑,全看准确率结果漏掉一大堆坏账。
0 回复
脚本小子小柯 专家 11小时前
建议把数据先做个过采样,不然模型确实容易偷懒。
0 回复

发表回复

支持 Markdown 格式