Gemini 3.8 Live 语音每小时只要 1.38 刀,成本直接把 GPT-Live-1 给压下去了
Google Deepmind 这次更新的 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个音频模型,在 Artificial Analysis 的语音到语音(speech-to-speech)榜单上拿到了顶端位置。最核心的竞争力在于价格,每小时语音对话的费用只有 1.38 美元,相比 OpenAI 的 GPT-Live-1 便宜得多。不过在实际体感上,由于 GPT-Live-1 支持全双工通信,听起来应该会更自然一些。
这两款新模型分别怎么选
这次 Google 一次性给了两个版本,一个是标准的 Gemini 3.8 Live,另一个是带了 Extended Thinking 的版本。
- Gemini 3.8 Live:主打低延迟的语音交互,适合那些需要快速响应、不需要深度思考的实时对话场景。
- Gemini 3.8 Live Extended Thinking:这个版本增加了思考过程,适合处理那些需要逻辑推理、复杂分析后再通过语音输出的任务。
成本与性能的实际权衡
对于开发者来说,1.38 美元/小时这个价格确实很有杀伤力。如果你在构建一个需要大量语音交互的应用,这个成本优势能省下不少预算。但这里有一个潜在的体验坑点:全双工(Full Duplex)能力。
GPT-Live-1 能够实现真正的实时双向通信,意味着你可以在 AI 说话的时候随时打断它,而不需要等待它说完一段话再触发识别。Gemini 3.8 Live 虽然在榜单分数上很高且价格极低,但在这种「自然打断」的流畅度上,可能还是比不过 OpenAI。
如果你对成本极其敏感,且应用场景不需要极高频的实时打断,那么 Gemini 3.8 Live 是目前性价比最高的选择。但如果你的产品追求的是像真人一样毫无停顿的对谈,GPT-Live-1 依然是那个天花板。
快速部署建议
如果你准备尝试 Gemini 3.8 Live,建议先用 Extended Thinking 版本跑一遍复杂逻辑的语音任务,确认输出质量满足要求后,再切换到标准版来优化响应速度和成本。
- 成本核算: 每小时 1.38 美元(注意这是基于语音时长计算的)。
- 性能基准: 参考 Artificial Analysis 的 speech-to-speech 实时排行榜。
- 关键差异: 重点观察在多轮对话中,Gemini 3.8 Live 的响应延迟与 GPT-Live-1 的全双工交互在实际体感上的差距。
免费 AI 工具箱 · 全部完全免费

终于不用盯着账单心疼了,上次用 GPT-Live 跑个长对话直接烧掉 10 刀,这次 1.38 刀真的敢全天候挂着。