用 Whisper 这种通用模型去处理尼泊尔语这种小语种

PromptCube 高级 3小时前 302 浏览 14 点赞 约 2 分钟

刚才翻 arXiv 看到一个挺有意思的研究,叫 SpeakPay。这个项目主要是解决尼泊尔移动支付应用里,视觉障碍人士没法用图形界面操作的问题。他们搞了一个语音优先的数字钱包,核心技术点在于怎么让 Whisper 这种“巨头”模型去听懂那些极其冷门的尼泊尔语金融指令。

说实话,如果不做任何处理,直接用 Whisper large-v2 的 zero-shot 能力去跑尼泊尔语金融指令,那个字错率(WER)居然高达 129.95%。这基本意味着模型在瞎猜,甚至连最基本的数字都听不明白。

研究团队非常有针对性地搞了一个叫 NepFinSpeech-403 的数据集,里面包含了 403 条尼泊尔语金融指令,涵盖了转账、充值、查余额等操作,重点是覆盖了 237 个不同的数字。他们用了 LoRA 这种轻量化的微调方式,效果提升非常暴力:

  • 字错率(WER)降幅: 从 129.95% 直接降到了 42.58%,相对降低了 67.2%。
  • 数字识别: 针对天城文(Devanagari)数字的识别准确率,从原本的 0.0% 直接拉到了 73.9%。
  • 实际交易成功率: 这个指标最硬核,从 1.67% 提升到了 33.33%,整整翻了 20 倍。

我最关注的一个细节是关于“数据效率”的结论。他们发现,对于这种特定领域的任务,其实没必要喂海量数据。只要喂进去 100 条左右的领域特定指令,就能把字错率砍掉一半;当数据量达到 300 条左右时,性能就开始进入平台期了。这对我们做垂直领域小模型落地非常有参考价值——在数据极度匮乏的情况下,LoRA + 几百条高质量垂直数据,真的能让通用模型“脱胎换骨”。

不过目前的瓶颈还在数字识别的细节上,比如模型还是会出现一些系统性的错误,比如数字前缀幻觉或者零的插入/删除。不过考虑到是从“完全不能用”到“能勉强用”,这个路径已经跑通了。

项目代码和数据集都开源了,感兴趣可以去 GitHub 搜一下:

https://github.com/subedibiraj/speakpay
LoRA语音识别Whisper尼泊尔语

全部回复 (4)

前端老刘 高级 3小时前
其实还得看语料质量,我之前试过拿那种带口音的录音喂,效果直接拉胯。
0 回复
内卷王调参侠 中级 3小时前
@前端老刘 语料质量确实关键,但小语种本身就缺乏标准化语音数据,哪怕洗干净也可能不足以训练出鲁棒模型,还是得靠多方位的语音多样性去补。
0 回复
大Max爱学习 初级 3小时前
我之前试过直接硬跑,遇到那种带背景噪音的金融词汇,识别出来的全是废话。
0 回复
阿杰在路上 中级 3小时前
别吹了,我之前用Whisper跑小语种,全是乱码,根本没法用。
0 回复

发表回复

支持 Markdown 格式