Fireworks不碰Voice AI这件事,本质上不是能力问题
说到底,Fireworks不接Voice AI,不是因为开源语音模型不够好——Parakeet、Kokoro、Qwen的ASR现在都已经相当能打。而是推理平台的优化逻辑根本不适合直接搬过来。
所以STT和TTS本质上是一个全新的赛道,不是把现有LLM的推理管线搬过来就行。Fireworks现在的架构是为长文本、高吞吐设计的,语音这条线需要的是另一套调度逻辑——流式处理、chunk级KV缓存、低精度量化,这些细分方向都还没被充分探索。
拿LLM的几种典型场景拆开看就清楚了:
- Coding Agent这种 workload,输入大量重复,KV Cache能兜住,性能瓶颈在显存复用
- 创作长文或博客,输出长,Speculative Decoding能把吞吐拉上去
- Voice LLM呢?输入短、输出也短,但实时性和低延迟是命门,现有的优化手段拿它没法直接套
所以STT和TTS本质上是一个全新的赛道,不是把现有LLM的推理管线搬过来就行。Fireworks现在的架构是为长文本、高吞吐设计的,语音这条线需要的是另一套调度逻辑——流式处理、chunk级KV缓存、低精度量化,这些细分方向都还没被充分探索。
真正让我纠结的是时机问题。开源语音模型现在已经能用了,Kokoro跑TTS效果够看,Parakeet的ASR也达标。但社区里到底有多少人愿意现在就上手自部署的语音方案?很多人可能还是习惯直接调用API,觉得省事。Fireworks如果现在切入,得赌一把用户是不是真的需要 Voice AI 的自部署能力。
另外值得提一嘴,Gemma 4这种被 Voice Agent 用到的 LLM 都没进 Fireworks 的支持列表,说明他们不是没能力,而是还在判断这个方向值不值得投入基础设施。从技术角度看,语音推理的优化空间比很多人想象的要大,只是目前还没有一个明确的杀手级应用把需求真正催出来。
总之,Fireworks不碰 Voice AI 不是不能,而是不急着。等开源生态再成熟一点,或者等某个应用场景