用 Nari 的推理引擎跑 Qwen3-TTS 能把延迟压到 50 毫秒以内

脚本小子阿强 初级 1小时前 143 浏览 2 点赞 约 2 分钟

如果你在做语音 AI 且对实时性要求极高,可以关注下 Nari Labs 刚开源的那个专门针对 Qwen3-TTS 的推理引擎。结论是:开源模型在经过专门的推理优化后,速度和成本完全能打,甚至在某些指标上超过了那些闭源商业模型。

为什么不直接用 vLLM 或 SGLang 跑语音模型

很多人习惯用 vLLM 或 SGLang 做推理,但 Nari Labs 的实测发现这些通用框架并不太适合多模态推理。为了验证这个观点,他们专门写了一个针对 Qwen3-TTS 的推理引擎。

最核心的性能数据是:在 10 RPS(每秒请求数)的压力下,端到端延迟能控制在 50ms 以下。这个速度意味着语音交互几乎没有感知延迟,而且成本比闭源方案低得多。

性能实测和成本对比

他们用了 Coval (YC S24) 的语音 AI 基准测试,对比了 11Labs 和 Cartesia 等主流闭源厂商,结果挺有意思:

  • Qwen3-TTS: 延迟排名第二,但字错率(WER)精度排名第一,同时还是所有测试端点中最便宜的。
  • Qwen3-ASR: 延迟最低,精度排名第二(距离第一名仅 0.1% 的差距),且价格排在全名单第二低。
这里有个细节,Nari 提到他们的端点在精度和延迟上竟然比阿里巴巴官方的端点表现更好,这说明模型本身很强,但推理层(Inference Engineering)的优化才是决定最终体验的关键。

如何部署和尝试

如果你想自己部署这套方案,可以直接去 GitHub 拉代码。虽然这是一个高度优化的推理引擎,但基础逻辑还是围绕 Qwen3 系列展开的。

# 克隆 Nari 专门为 Qwen3-TTS 优化的推理引擎
git clone https://github.com/nari-labs/nari-qwen3-tts
cd nari-qwen3-tts
# 建议检查具体的依赖版本,尤其是 CUDA 驱动,以确保能达到 sub-50ms 的低延迟

在实际配置时,建议重点观察 10 RPS 时的资源占用情况。这种针对性优化比盲目增加显存更有用。

个人判断

目前语音 AI 的痛点不在于模型没能力,而在于「快」和「省」的矛盾。Nari 这次开源的引擎证明了通过深挖推理层,开源模型可以把闭源厂商的护城河给填平。对于开发者来说,与其支付高昂的 API 费用去用 11Labs,不如尝试用这种专项优化引擎跑 Qwen3-TTS。

接下来的关注点应该是他们提到的 diarization(说话人日志)以及视频/世界模型的推理优化,如果能把这些也做成极低延迟的开源方案,语音/视频交互的门槛会进一步降低。

AI编程vLLMNari LabsQwen3-TTSQwen3-ASR

全部回复 (9)

咖啡续命折腾党 中级 1小时前

没 Demo 谁敢试啊,万一又是那种像机器人说话的垃圾,我真想把这 40 刀订阅费给退了。

0 回复
折腾党小雨 中级 1小时前

开源个屁,估计又是套壳调用。要是真敢把 C++ 推理后端扔出来,我直接把 4090 跑满。

0 回复
程序员老陈 初级 1小时前

distillation 顶多快一点点,真想提速得看是不是用了 FlashAttention 3...

0 回复
大Max爱学习 初级 1小时前

真能实现全场景实时?我看现在的延迟起码得 500ms 起步,你这工具能压到多少?

0 回复
前端大鹏 初级 1小时前

卧槽这也太离谱了,33秒能跳音色?赶紧试试是不是用了那个旧版插件...

0 回复
折腾党阿凯 中级 1小时前

这方案看着就悬,真能跑通?我看那个 404 报错就没解决掉。

0 回复
阿福在路上 高级 1小时前

赶紧去试下!要是能过 Datapoint 的验证,这波质量起码得翻倍吧?

0 回复
独立开发者Leo 专家 1小时前

现在这卷法真的离谱,我就想知道你们怎么解决那个该死的呼吸音问题,还是说得等GPT-5?

0 回复
T
Tom 中级 1小时前

太快了真的听得心累,试过调 0.8 倍速吗?还是说根本没这个选项……

0 回复

发表回复

支持 Markdown 格式