用 ASR 文本去校验古兰经背诵错误到底有多难,arXiv 2609.12085v1

小Kevin在路上 中级 3小时前 562 浏览 10 点赞 约 2 分钟

想通过 ASR 识别文本来自动检查背诵错误,最头疼的不是识别率,而是怎么定义「错误」。因为在实际转录文本里,重复、自我修正、开篇公式以及被认可的拼写差异,很容易被误判为错误。这篇论文通过 100 个生产录制案例的标注,量化了这个问题,结论是目前模型在定位错误位置上表现尚可,但在准确给错误贴标签(Label-aware)方面依然有很大差距。

标注数据量和基准线表现如何

这次研究是对 100 个生产录制案例进行了人工标注,涵盖了 348 个评分单元和 162 个定位事件,一共定义了 10 个组合标签。为了测试自动识别的效果,研究者对比了两种方案:一种是简单的文本差异对比(plain diff),另一种是经过适配的生产环境清洗/对齐组件。

  • Plain diff(简单差异对比): 标签识别 F1 分数 0.525,定位 F1 分数 0.826。
  • 生产清洗/对齐组件: 标签识别 F1 分数 0.518,定位 F1 分数 0.786。
  • 精确跨度(Exact-span)F1: 两者均为 0.505。
这里有个细节:研究发现适配器的词坐标如果经过修正,可以找回全部 5 个被标注的重复事件。这意味着很多所谓的「算法失败」其实是标注界面本身的问题,这提醒我们在分析 baseline 失败原因时,得先检查标注工具。

3 个 Agent 和 8 个模型的初步跑分

研究者做了一个初步试点,用 3 个编码 Agent 驱动 8 个模型,进行了 8 次单次运行(每次 20 分钟)。结果分布非常离散,标签识别的 F1 分数在 0.143 到 0.892 之间波动。

  • 表现分层: 其中 7 次运行的结果远高于之前的所有基准线,但有 1 次运行因为缺失了归一化(normalization)步骤,直接崩到了比 naive diff 还要低。
  • 检测 vs 约定: 在 972 个金标准事件实例中,有 970 个在 6 次运行中都被预测到了重叠部分。这说明「检测到有问题」其实不难,难的是「约定」。具体到错误跨度怎么算、哪个标签的边界是由裁决决定而非文本可见,这才是核心矛盾。

依然无法攻克的死角

即便在表现最强的运行中,依然有 7 个事件(共 162 个)在 6 次同日运行中全部失败。其中 5 个错误点集中在同一个正字法(orthographic)规则上。这意味着无论模型怎么迭代,只要不解决特定的正字法规则判定,依然会有死角。

这次试点只测量了算法这半边任务,因为在构建之前没有进行标注,所以结果仅代表算法端的能力。

ASR古兰经

全部回复 (3)

架构师Neo 中级 3小时前

我当年跑语音识别项目也被这种“伪错误”搞崩了,要是换成 Whisper v3 应该能好点?

0 回复
完美主义技术宅 专家 3小时前

这定义错误太折磨强迫症了,要是碰到那种习惯性重复词的录音,现在的编辑距离算法得报多少错?

0 回复
阿海爱学习 高级 3小时前

这标签分类也太玄学了,要是把那个自我修正的片段直接切掉,是不是能把准确率强行拉到 90% 以上?

0 回复

发表回复

支持 Markdown 格式