Gemini 3.8 Live 语音每小时只要 1.38 刀,成本直接把 GPT-Live-1 给压下去了

前端大山 专家 40分钟前 320 浏览 1 点赞 约 2 分钟

Google Deepmind 这次更新的 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个音频模型,在 Artificial Analysis 的语音到语音(speech-to-speech)榜单上拿到了顶端位置。最核心的竞争力在于价格,每小时语音对话的费用只有 1.38 美元,相比 OpenAI 的 GPT-Live-1 便宜得多。不过在实际体感上,由于 GPT-Live-1 支持全双工通信,听起来应该会更自然一些。

这两款新模型分别怎么选

这次 Google 一次性给了两个版本,一个是标准的 Gemini 3.8 Live,另一个是带了 Extended Thinking 的版本。

  • Gemini 3.8 Live:主打低延迟的语音交互,适合那些需要快速响应、不需要深度思考的实时对话场景。
  • Gemini 3.8 Live Extended Thinking:这个版本增加了思考过程,适合处理那些需要逻辑推理、复杂分析后再通过语音输出的任务。
Gemini 3.8 Live 语音每小时只要 1.38 刀,成本直接把 GPT-Live-1 给压下去了

成本与性能的实际权衡

对于开发者来说,1.38 美元/小时这个价格确实很有杀伤力。如果你在构建一个需要大量语音交互的应用,这个成本优势能省下不少预算。但这里有一个潜在的体验坑点:全双工(Full Duplex)能力。

GPT-Live-1 能够实现真正的实时双向通信,意味着你可以在 AI 说话的时候随时打断它,而不需要等待它说完一段话再触发识别。Gemini 3.8 Live 虽然在榜单分数上很高且价格极低,但在这种「自然打断」的流畅度上,可能还是比不过 OpenAI。

如果你对成本极其敏感,且应用场景不需要极高频的实时打断,那么 Gemini 3.8 Live 是目前性价比最高的选择。但如果你的产品追求的是像真人一样毫无停顿的对谈,GPT-Live-1 依然是那个天花板。

快速部署建议

如果你准备尝试 Gemini 3.8 Live,建议先用 Extended Thinking 版本跑一遍复杂逻辑的语音任务,确认输出质量满足要求后,再切换到标准版来优化响应速度和成本。

  • 成本核算: 每小时 1.38 美元(注意这是基于语音时长计算的)。
  • 性能基准: 参考 Artificial Analysis 的 speech-to-speech 实时排行榜。
  • 关键差异: 重点观察在多轮对话中,Gemini 3.8 Live 的响应延迟与 GPT-Live-1 的全双工交互在实际体感上的差距。
Google DeepMindAIGCArtificial AnalysisGemini 3.8 LiveGPT-Live-1

全部回复 (3)

全栈小李 高级 34分钟前

终于不用盯着账单心疼了,上次用 GPT-Live 跑个长对话直接烧掉 10 刀,这次 1.38 刀真的敢全天候挂着。

0 回复
前端大鹏 初级 34分钟前

我试过用它练口语,反应快得吓人,就是不知道能不能扛住那个 200k 的上下文...

0 回复
养生全栈 中级 32分钟前

这价格确实离谱,但我更在乎延迟,这玩意儿跑在 1.5 Flash 上会有明显的卡顿感吗?

0 回复

发表回复

支持 Markdown 格式