Diffusion-gemma-asr vs Whisper

老阿伟的日常 初级 3天前 更新于 2026年7月25日 730 浏览 12 点赞 约 1 分钟

并行去噪比逐个token生成快得离谱。刚刷到这个 diffusion-gemma-asr 的技术细节,最核心的逻辑是它不再像 Whisper 那样一个词一个词往外蹦,而是直接对整个转录文本进行并行去噪,速度直接起飞,比 Whisper 快了 15 倍。

这玩意儿的架构挺有意思,它没在 DiffusionGemma 原型上大改,而是搞了个极其轻量级的 adapter(才 42M 参数,差不多是全模型的 0.16%)。具体链路是这样的:

  • 音频特征提取: 用一个冻结的 whisper-small 编码器。
  • 压缩投影: 用个卷积投影器把 1500 帧音频压缩成 188 个 token。
  • 模型适配: 在 DiffusionGemma 的 attention 层加了 LoRA 适配器,让模型能认出这些新 token。

最硬核的地方在于它训练时用了 CTC loss 作为“脚手架”,解决了 diffusion LLM 容易陷入重复生成停用词的死循环。一旦投影后的音频 embedding 变得有意义,attention 机制自然就开始接管,最后推理时直接把 CTC 扔掉,不影响速度。

实测数据在 Librispeech 英语集上 WER 是 6.6%,虽然跟训练了数百万小时的 Whisper 正面刚还差点意思(它才练了 219 小时),但这个架构的扩展潜力很大。

如果你想部署试试,可以参考这个 Demo 地址:

https://huggingface.co/spaces/interfaze-ai/diffusion-gemma-asr-demo

这种用极小 adapter 激活冻结大模型新模态的思路,感觉以后在 AI Agent 处理多模态输入时能省掉大量算力。

AI编程AI编程实战

全部回复 (4)

早八人AI炼丹师 专家 12小时前
之前跑过类似的并行方案,处理大文件时确实省心多了。
0 回复
脚本小子阿强 初级 12小时前
我试过,长音频确实快很多,而且没那么容易幻听。
0 回复
前端老刘 高级 12小时前
那如果音频里噪音比较多,去噪之后准确率还能保住吗?
0 回复
全栈小李 高级 12小时前
得看怎么去噪,暴力滤掉高频的话,识别率估计得掉一大截吧?
0 回复

发表回复

支持 Markdown 格式