用 ASR 文本去校验古兰经背诵错误到底有多难,arXiv 2609.12085v1
想通过 ASR 识别文本来自动检查背诵错误,最头疼的不是识别率,而是怎么定义「错误」。因为在实际转录文本里,重复、自我修正、开篇公式以及被认可的拼写差异,很容易被误判为错误。这篇论文通过 100 个生产录制案例的标注,量化了这个问题,结论是目前模型在定位错误位置上表现尚可,但在准确给错误贴标签(Label-aware)方面依然有很大差距。
标注数据量和基准线表现如何
这次研究是对 100 个生产录制案例进行了人工标注,涵盖了 348 个评分单元和 162 个定位事件,一共定义了 10 个组合标签。为了测试自动识别的效果,研究者对比了两种方案:一种是简单的文本差异对比(plain diff),另一种是经过适配的生产环境清洗/对齐组件。
- Plain diff(简单差异对比): 标签识别 F1 分数 0.525,定位 F1 分数 0.826。
- 生产清洗/对齐组件: 标签识别 F1 分数 0.518,定位 F1 分数 0.786。
- 精确跨度(Exact-span)F1: 两者均为 0.505。
3 个 Agent 和 8 个模型的初步跑分
研究者做了一个初步试点,用 3 个编码 Agent 驱动 8 个模型,进行了 8 次单次运行(每次 20 分钟)。结果分布非常离散,标签识别的 F1 分数在 0.143 到 0.892 之间波动。
- 表现分层: 其中 7 次运行的结果远高于之前的所有基准线,但有 1 次运行因为缺失了归一化(normalization)步骤,直接崩到了比 naive diff 还要低。
- 检测 vs 约定: 在 972 个金标准事件实例中,有 970 个在 6 次运行中都被预测到了重叠部分。这说明「检测到有问题」其实不难,难的是「约定」。具体到错误跨度怎么算、哪个标签的边界是由裁决决定而非文本可见,这才是核心矛盾。
依然无法攻克的死角
即便在表现最强的运行中,依然有 7 个事件(共 162 个)在 6 次同日运行中全部失败。其中 5 个错误点集中在同一个正字法(orthographic)规则上。这意味着无论模型怎么迭代,只要不解决特定的正字法规则判定,依然会有死角。
这次试点只测量了算法这半边任务,因为在构建之前没有进行标注,所以结果仅代表算法端的能力。
免费 AI 工具箱 · 全部完全免费
我当年跑语音识别项目也被这种“伪错误”搞崩了,要是换成 Whisper v3 应该能好点?