DCASE 2026 Task 6 那个长音频片段检索 [email protected] 居然能跑到
这次 DCASE 2026 Task 6 搞的是 Audio Moment Retrieval (AMR),简单说就是给一段好几分钟的长音频,再给一段随意的文本描述,让 AI 把音频里对应的开始和结束时间点给找出来。这玩意儿对跨模态对齐和长程时间建模的要求极高,因为音频太长,模型很容易在定位时迷路。
这次挑战赛的结果挺有意思,Baseline 跑出来的 [email protected] 只有 13.56%,这个 Baseline 是用预训练的 MS-CLAP 特征提取器搭配一个基于 DETR(Detection Transformer)的片段检测网络,而且是在手动标注数据集和合成数据集上训练的。这个 13.56% 的分数说明在长音频里找特定片段依然是个大坑。
但这次参赛的 21 支队伍(共提交了 59 个系统)把分数拉高了一大截,前三名的最高分达到了 48.59%,差不多是 Baseline 的 3.5 倍。这中间的差距主要体现在两个地方:一是把音频-文本的特征提取器给加强了,二是优化了片段检测网络。
具体到怎么提分,前三名的队伍在操作上有两个很关键的细节。首先是做了置信度分数校准(Confidence Score Calibration),这在定位任务里很常见,能过滤掉很多误报。其次是采用了不同时间分辨率特征的集成(Ensembling across different temporal resolutions),通过多尺度特征来弥补单一分辨率在定位精度上的不足。
如果要复现这个流程,核心架构其实就是 MS-CLAP 提取特征 → DETR 架构做检测。但从结果看,如果只用基础的 DETR 很难突破,必须在特征增强和后处理校准上下功夫。
这次任务定义的具体流程如下:
1. 输入:一段数分钟长的音频文件 + 一个自由格式的文本查询词。
2. 输出:一组时间戳对 $[start, end]$。
3. 评价指标:采用 [email protected],即预测片段与真实片段的重叠度(IoU)超过 0.7 且排名第一时计为命中。
从 13.56% 到 48.59% 的跨度说明,虽然长音频检索依然很难,但通过强化特征对齐和多尺度集成,性能是有大幅提升空间的。
这数值看得我后怕,上次我死磕那个CLAP模型,定位精度掉到个位数的时候差点把电脑给砸了。