阿里这次出的 Qwen3.8-Flash-Next 简直是在掀桌子
这次通义千问团队搞出来的 Qwen3.8-Flash-Next 真的让我有点坐不住了。大家都在卷参数规模,阿里这次反其道而行之,直接在架构层面玩起了“极致性价比”。它其实是 Qwen4 架构的一个预览版,核心思路就是用 MoE(Mixture-of-Experts)架构把成本压到地板上。
如果说之前的模型是在卷“谁更聪明”,那 Qwen3.8-Flash-Next 就在卷“谁能让开发者用得起”。对于我们这种需要大规模部署应用的人来说,这种能把 Token 单价打下来的模型才是真正的生产力工具。
我研究了一下它的参数配置,逻辑非常硬核:虽然模型总参数量达到了 125B,但它在处理每个 token 时,实际上只激活了其中的 6B 参数。这意味着什么?这意味着它在保持超大规模模型“智力”的同时,推理开销却缩减到了极低水平。
最让我惊讶的是它的实测表现,即便这种“轻量化”的运行方式,在编程能力(Coding)和办公场景(Office)的 Benchmark 上,竟然直接把 DeepSeek-V4-Flash 还有 Claude Opus 4.6 这些大块头给超过去了。
我们可以从这几个维度看下它的杀伤力:
- 训练成本: 官方给出的数据是,它的训练成本只有同级别模型的九分之一,这在目前的算力竞赛里简直是降维打击。
- 推理效率: 这种 125B 总参数、仅激活 6B 的 MoE 策略,极大地缓解了长文本推理时的显存压力,非常适合做高并发的 AI Agent 工作流。
- 市场冲击: 这种定价策略一旦大规模落地,OpenAI 和 Anthropic 在 API 价格战上会面临巨大的生存压力。
如果说之前的模型是在卷“谁更聪明”,那 Qwen3.8-Flash-Next 就在卷“谁能让开发者用得起”。对于我们这种需要大规模部署应用的人来说,这种能把 Token 单价打下来的模型才是真正的生产力工具。
事件追踪 · 相关报道
清华唐杰团队把 GLM 练成 MoE 后
7天前
通义千问 3.8 那个 27B 的模型居然能在这个量级把 3.
12天前
阿里家的开源模型下载量冲到 30 亿次直接把 Meta 和谷歌给超了
13天前
苹果这次为了在内地落地 Apple Intelligence
13天前
苹果在阿里帮衬下搞了套中国专属的大模型
13天前
开源模型这块中国现在确实是在抢风头
13天前
免费 AI 工具箱 · 全部完全免费
