用 Whisper 这种通用模型去处理尼泊尔语这种小语种
刚才翻 arXiv 看到一个挺有意思的研究,叫 SpeakPay。这个项目主要是解决尼泊尔移动支付应用里,视觉障碍人士没法用图形界面操作的问题。他们搞了一个语音优先的数字钱包,核心技术点在于怎么让 Whisper 这种“巨头”模型去听懂那些极其冷门的尼泊尔语金融指令。
我最关注的一个细节是关于“数据效率”的结论。他们发现,对于这种特定领域的任务,其实没必要喂海量数据。只要喂进去 100 条左右的领域特定指令,就能把字错率砍掉一半;当数据量达到 300 条左右时,性能就开始进入平台期了。这对我们做垂直领域小模型落地非常有参考价值——在数据极度匮乏的情况下,LoRA + 几百条高质量垂直数据,真的能让通用模型“脱胎换骨”。
说实话,如果不做任何处理,直接用 Whisper large-v2 的 zero-shot 能力去跑尼泊尔语金融指令,那个字错率(WER)居然高达 129.95%。这基本意味着模型在瞎猜,甚至连最基本的数字都听不明白。
研究团队非常有针对性地搞了一个叫 NepFinSpeech-403 的数据集,里面包含了 403 条尼泊尔语金融指令,涵盖了转账、充值、查余额等操作,重点是覆盖了 237 个不同的数字。他们用了 LoRA 这种轻量化的微调方式,效果提升非常暴力:
- 字错率(WER)降幅: 从 129.95% 直接降到了 42.58%,相对降低了 67.2%。
- 数字识别: 针对天城文(Devanagari)数字的识别准确率,从原本的 0.0% 直接拉到了 73.9%。
- 实际交易成功率: 这个指标最硬核,从 1.67% 提升到了 33.33%,整整翻了 20 倍。
我最关注的一个细节是关于“数据效率”的结论。他们发现,对于这种特定领域的任务,其实没必要喂海量数据。只要喂进去 100 条左右的领域特定指令,就能把字错率砍掉一半;当数据量达到 300 条左右时,性能就开始进入平台期了。这对我们做垂直领域小模型落地非常有参考价值——在数据极度匮乏的情况下,LoRA + 几百条高质量垂直数据,真的能让通用模型“脱胎换骨”。
不过目前的瓶颈还在数字识别的细节上,比如模型还是会出现一些系统性的错误,比如数字前缀幻觉或者零的插入/删除。不过考虑到是从“完全不能用”到“能勉强用”,这个路径已经跑通了。
项目代码和数据集都开源了,感兴趣可以去 GitHub 搜一下:
https://github.com/subedibiraj/speakpay 事件追踪 · 相关报道
Frank Morales Aguilera 这篇关于「永久性架构」
13天前
给跑团存音频做了个长期记忆引擎
13天前
在笔记本上跑通全参数微调
15天前
AI 语音克隆让诈骗成本归零,老年人成了最好割的韭菜
15天前
在50美元 Arduino Uno Q 上构建本地运行的AI语音代理
2026/8/5
微调一个LLM到底吃多少显存?答案是个范围
2026/8/2
免费 AI 工具箱 · 全部完全免费