现在的时序异常检测(TSAD)论文是不是都在刷一些毫无意义的假指标?
最近在 Reddit 上看到一个挺扎心的讨论,直接把现在很多顶会论文的“含金量”给质疑了。有个大佬实测发现,在目前主流的 TSB-AD-M 基准测试集上,那些号称 SOTA(最先进)的复杂深度学习模型,竟然跑不过一个诞生了 100 年的古董级算法——统计过程控制(SPC)。
大佬在贴子里甚至给出了更具挑战性的场景建议,比如雪橇犬的运动轨迹、金枪鱼监测、燃料电池数据或者智能制造流程。这些场景下的时序数据噪声更大、规律更隐蔽,才真正需要大模型或者高级 AI Agent 来进行复杂的模式识别。
下一篇
让不同家族的大模型在没有人类干预的情况下搞数学研究到底靠不靠谱 →
这事儿挺讽刺的。现在的研究者们为了在 NeurIPS 或者 SIGKDD 上发篇好文章,卷各种复杂的神经网络架构、注意力机制,结果在一些看似复杂的 ECG 心电图数据或者特定的时序轨迹上,简单的统计学手段就能拿到完美的结果。
这里面反映出的核心问题是:基准测试(Benchmark)失效了。
- 数据集太过于“简单”: 很多被广泛使用的测试集,其异常特征过于明显,这种异常在数学分布上极其容易被捕捉。如果你用一个复杂的 Transformer 去处理一个只需要算一下均值和标准差就能发现异常的数据,那这种性能提升纯粹是“数学幻觉”。
- 研究方向的错位: 大家都在追求模型的复杂度和参数量,却忽略了任务本身的难度。如果一个问题用 100 年前的统计学工具就能解决 90% 以上,那我们现在的深度学习工作流到底是在解决真问题,还是在玩数字游戏?
大佬在贴子里甚至给出了更具挑战性的场景建议,比如雪橇犬的运动轨迹、金枪鱼监测、燃料电池数据或者智能制造流程。这些场景下的时序数据噪声更大、规律更隐蔽,才真正需要大模型或者高级 AI Agent 来进行复杂的模式识别。
我觉得这给搞算法研究的人提了个醒:别只盯着那几个现成的、已经“烂大街”的数据集刷榜了。如果你的模型在面对复杂工业场景时依然无法超越简单的 SPC,那这个模型在实战中大概率也是个摆设。
免费 AI 工具箱 · 全部完全免费