用 Nari 的推理引擎跑 Qwen3-TTS 能把延迟压到 50 毫秒以内
如果你在做语音 AI 且对实时性要求极高,可以关注下 Nari Labs 刚开源的那个专门针对 Qwen3-TTS 的推理引擎。结论是:开源模型在经过专门的推理优化后,速度和成本完全能打,甚至在某些指标上超过了那些闭源商业模型。
为什么不直接用 vLLM 或 SGLang 跑语音模型
很多人习惯用 vLLM 或 SGLang 做推理,但 Nari Labs 的实测发现这些通用框架并不太适合多模态推理。为了验证这个观点,他们专门写了一个针对 Qwen3-TTS 的推理引擎。
最核心的性能数据是:在 10 RPS(每秒请求数)的压力下,端到端延迟能控制在 50ms 以下。这个速度意味着语音交互几乎没有感知延迟,而且成本比闭源方案低得多。
性能实测和成本对比
他们用了 Coval (YC S24) 的语音 AI 基准测试,对比了 11Labs 和 Cartesia 等主流闭源厂商,结果挺有意思:
- Qwen3-TTS: 延迟排名第二,但字错率(WER)精度排名第一,同时还是所有测试端点中最便宜的。
- Qwen3-ASR: 延迟最低,精度排名第二(距离第一名仅 0.1% 的差距),且价格排在全名单第二低。
如何部署和尝试
如果你想自己部署这套方案,可以直接去 GitHub 拉代码。虽然这是一个高度优化的推理引擎,但基础逻辑还是围绕 Qwen3 系列展开的。
# 克隆 Nari 专门为 Qwen3-TTS 优化的推理引擎
git clone https://github.com/nari-labs/nari-qwen3-tts
cd nari-qwen3-tts
# 建议检查具体的依赖版本,尤其是 CUDA 驱动,以确保能达到 sub-50ms 的低延迟
在实际配置时,建议重点观察 10 RPS 时的资源占用情况。这种针对性优化比盲目增加显存更有用。
个人判断
目前语音 AI 的痛点不在于模型没能力,而在于「快」和「省」的矛盾。Nari 这次开源的引擎证明了通过深挖推理层,开源模型可以把闭源厂商的护城河给填平。对于开发者来说,与其支付高昂的 API 费用去用 11Labs,不如尝试用这种专项优化引擎跑 Qwen3-TTS。
接下来的关注点应该是他们提到的 diarization(说话人日志)以及视频/世界模型的推理优化,如果能把这些也做成极低延迟的开源方案,语音/视频交互的门槛会进一步降低。
免费 AI 工具箱 · 全部完全免费
全部回复 (9)
折
程
大
前
折
阿
独
T
没 Demo 谁敢试啊,万一又是那种像机器人说话的垃圾,我真想把这 40 刀订阅费给退了。