放弃逐词蹦字,Diffusion-Gemma-ASR 用并行去噪把语音转写速度提升了 15 倍
而 Diffusion-Gemma-ASR 走的是并行去噪路线。简单来说,它不再一个词一个词地往外蹦,而是直接对整个转录文本进行并行去噪处理。这种从“串行生成”到“并行还原”的范式转移,让它的推理速度直接起飞,实测比 Whisper 快了 15 倍。在实际应用场景中,这意味着原本需要等待几秒的转写结果,现在几乎可以实现瞬时响应。
最让我感兴趣的是它的架构实现,它并没有对 DiffusionGemma 原型进行大规模的结构重组,而是采用了一种极其轻量级的适配策略。整个模型中只增加了一个 42M 参数的 adapter,这个体量仅占全模型的 0.16% 左右,但却成功让大模型具备了处理音频模态的能力。
具体到技术链路,它的处理流程分为三步:首先,利用一个处于冻结状态的 whisper-small 编码器来提取音频特征;接着,通过一个卷积投影器(Convolutional Projector)将 1500 帧的音频特征强行压缩成 188 个 token;最后,在 DiffusionGemma 的 attention 层中植入 LoRA 适配器,让模型能够识别并理解这些由音频转换而来的新 token。
这里有一个非常硬核的训练细节:Diffusion LLM 在处理这类任务时,极容易陷入重复生成停用词的“死循环”。为了解决这个问题,团队在训练阶段引入了 CTC loss(连接时序分类损失)作为“脚手架”。这个设计非常巧妙,CTC loss 在训练初期起到了引导作用,确保投影后的音频 embedding 具有明确的语义意义。一旦 attention 机制能够正确接管这些信号,CTC loss 就可以在推理阶段被直接扔掉,完全不影响最终的运行速度。
从性能数据来看,该模型在 Librispeech 英语测试集上的词错率(WER)达到了 6.6%。虽然这个数字在绝对值上还无法与那些经过数百万小时数据喂养的 Whisper 顶尖版本正面硬刚,但考虑到 Diffusion-Gemma-ASR 仅使用了 219 小时的训练数据,这个效率比其实相当惊人。
这种通过极小 adapter 激活冻结大模型新模态的思路,其实给了我们很多启发。在目前的 AI Agent 架构中,多模态输入的处理往往需要巨大的算力支持,如果能用 0.1% 的参数量就实现模态跨越,且能通过并行化大幅降低延迟,那么未来的实时语音交互 Agent 可能会摆脱繁重的计算开销。
如果你想验证这个速度提升,可以直接去 HuggingFace 的 interfaze-ai/diffusion-gemma-asr-demo 空间尝试。这种并行去噪的架构潜力很大,很可能会成为未来 ASR 领域优化推理延迟的主流方向。