Diffusion-gemma-asr vs Whisper
并行去噪比逐个token生成快得离谱。刚刷到这个 diffusion-gemma-asr 的技术细节,最核心的逻辑是它不再像 Whisper 那样一个词一个词往外蹦,而是直接对整个转录文本进行并行去噪,速度直接起飞,比 Whisper 快了 15 倍。
最硬核的地方在于它训练时用了 CTC loss 作为“脚手架”,解决了 diffusion LLM 容易陷入重复生成停用词的死循环。一旦投影后的音频 embedding 变得有意义,attention 机制自然就开始接管,最后推理时直接把 CTC 扔掉,不影响速度。
下一篇
2026年Cursor Agent模式与Composer功能深度对比指南 →
这玩意儿的架构挺有意思,它没在 DiffusionGemma 原型上大改,而是搞了个极其轻量级的 adapter(才 42M 参数,差不多是全模型的 0.16%)。具体链路是这样的:
- 音频特征提取: 用一个冻结的 whisper-small 编码器。
- 压缩投影: 用个卷积投影器把 1500 帧音频压缩成 188 个 token。
- 模型适配: 在 DiffusionGemma 的 attention 层加了 LoRA 适配器,让模型能认出这些新 token。
最硬核的地方在于它训练时用了 CTC loss 作为“脚手架”,解决了 diffusion LLM 容易陷入重复生成停用词的死循环。一旦投影后的音频 embedding 变得有意义,attention 机制自然就开始接管,最后推理时直接把 CTC 扔掉,不影响速度。
实测数据在 Librispeech 英语集上 WER 是 6.6%,虽然跟训练了数百万小时的 Whisper 正面刚还差点意思(它才练了 219 小时),但这个架构的扩展潜力很大。
如果你想部署试试,可以参考这个 Demo 地址:
https://huggingface.co/spaces/interfaze-ai/diffusion-gemma-asr-demo这种用极小 adapter 激活冻结大模型新模态的思路,感觉以后在 AI Agent 处理多模态输入时能省掉大量算力。