AI估算项目的真实精度到底有多少?
很多人在吹AI能精准预估项目工时和成本,但把这事儿量化到“可证伪”的程度后,结果可能挺让人失望的。最近看了一组关于AI估算能力的压力测试,对方用9个公开数据集(包括COCOMO81、PROMISE等)做了实操验证,结论是:目前没有任何一种模型类能通过预设的基准线。
最值得开发者参考的是他们处理数据泄露(Leakage)的逻辑。很多AI估算模型看起来很准,其实是因为数据集里包含了“后验”属性。比如某些数据集里的“需求稳定性”是通过项目测试阶段的修改次数计算出来的,这在项目启动时根本不可能知道。他们通过自动化审计剔除了这些属性,只保留了真正的先验数据。
下一篇
分享一个代码下载站14年数据的残酷真相 →
这套测试最硬核的地方在于它在运行前就把“及格线”提交到了Git,防止了结果出来后再通过调整参数来刷分。
它的判定标准非常严苛:
- PRED(25): 预估值在实际值25%误差范围内的比例必须 $\ge 55\%$(且需在至少2个数据集上达成)。
- MdAPE: 中位数绝对百分比误差必须 $\le 22\%$。
- 覆盖率: 实际值落在名义90%区间内的概率必须在90% $\pm 5$ 个百分点之间。
- 对比基准: 必须击败简单的类别中位数回归以及人类专家的记录值。
最值得开发者参考的是他们处理数据泄露(Leakage)的逻辑。很多AI估算模型看起来很准,其实是因为数据集里包含了“后验”属性。比如某些数据集里的“需求稳定性”是通过项目测试阶段的修改次数计算出来的,这在项目启动时根本不可能知道。他们通过自动化审计剔除了这些属性,只保留了真正的先验数据。
对于想在公司内部部署AI Agent来做任务估算的同学,建议参考这个验证逻辑:不要用随机切分数据集,要用时间顺序切分(Time-ordered evaluation)或留项目交叉验证(Leave-projects-out),否则模型在“偷看未来”,得出的准确率全是泡沫。
完整的基准测试代码和环境配置在下面这个路径(MIT协议,可复现):
https://github.com/NaCode-Studios/metis-benchmark