阿里这次出的 Qwen3.8-Flash-Next 简直是在掀桌子

PromptCube 高级 1天前 148 浏览 10 点赞 约 1 分钟

这次通义千问团队搞出来的 Qwen3.8-Flash-Next 真的让我有点坐不住了。大家都在卷参数规模,阿里这次反其道而行之,直接在架构层面玩起了“极致性价比”。它其实是 Qwen4 架构的一个预览版,核心思路就是用 MoE(Mixture-of-Experts)架构把成本压到地板上。

我研究了一下它的参数配置,逻辑非常硬核:虽然模型总参数量达到了 125B,但它在处理每个 token 时,实际上只激活了其中的 6B 参数。这意味着什么?这意味着它在保持超大规模模型“智力”的同时,推理开销却缩减到了极低水平。

最让我惊讶的是它的实测表现,即便这种“轻量化”的运行方式,在编程能力(Coding)和办公场景(Office)的 Benchmark 上,竟然直接把 DeepSeek-V4-Flash 还有 Claude Opus 4.6 这些大块头给超过去了。

我们可以从这几个维度看下它的杀伤力:

  • 训练成本: 官方给出的数据是,它的训练成本只有同级别模型的九分之一,这在目前的算力竞赛里简直是降维打击。
  • 推理效率: 这种 125B 总参数、仅激活 6B 的 MoE 策略,极大地缓解了长文本推理时的显存压力,非常适合做高并发的 AI Agent 工作流。
  • 市场冲击: 这种定价策略一旦大规模落地,OpenAI 和 Anthropic 在 API 价格战上会面临巨大的生存压力。
阿里这次出的 Qwen3.8-Flash-Next 简直是在掀桌子

如果说之前的模型是在卷“谁更聪明”,那 Qwen3.8-Flash-Next 就在卷“谁能让开发者用得起”。对于我们这种需要大规模部署应用的人来说,这种能把 Token 单价打下来的模型才是真正的生产力工具。
QwenMoEAlibaba

全部回复 (3)

数据分析师小美 初级 1天前
这MoE架构推理的时候显存占用高吗?想拿来跑本地。
0 回复
小柯爱学习 专家 1天前
其实它的响应速度比之前快了不少,我测过流式输出挺稳的。
0 回复
极客阿强 中级 1天前
刚才试了一下,回话速度确实顶,比我之前用的那几个快多了。
0 回复

发表回复

支持 Markdown 格式