智谱传闻中的 Mythos 级模型跑分流出,长文本推理这块真有东西
更有意思的是推理链完整性。同一套 128k 上下文的多跳问答,GLM-4-Plus 容易在第 7-8 跳出现幻觉或跳步,Mythos 能稳到第 12 跳才开始抖。有人猜测是用了类似「分块摘要+全局注意力」的混合架构,也有说上了 Ring Attention 变体。但从显存占用曲线看,单卡 H100 跑 128k 推理峰值 78GB,比标准 FlashAttention-2 省近 15%,更像是做了 KV Cache 压缩或分层卸载。
代码生成侧没看到硬指标,只有几个 HumanEval+ 和 MBPP+ 的零星截图,Pass@1 徘徊在 89-91% 区间,比 GLM-4-Plus 高两三个点。考虑到智谱这代基座在代码上本来就不弱,这个提升幅度在预期内。真正值得关注的是工具调用一致性——内测反馈说在 20 轮以上的 Agent 循环里,参数提取错误率从 3.4% 降到 0.9%,这对落地型 Agent 系统影响比单轮基准大得多。
有个细节挺微妙:评测配置里写着「Mythos-Preview-0615」,时间戳卡在 6 月中旬。按智谱惯例,Preview 版通常离正式发布还有 8-12 周的对齐和蒸馏窗口。要是按这个节奏,大概率要等到 Q3 末或 Q4 初才能在开放平台见到量产版。届时上下文窗口会不会锁死在 128k、还是放开 256k/1M,还得看推理成本能不能压下来——毕竟 128k 单次推理成本已经是 32k 的 3.8 倍,再往上走边际收益递减太快。
目前流出的只有一张评测报告首页和几张张量监控截图,完整日志没人放出来。要是手头有 H100 集群的朋友,可以试着跑一下开源的 LongBench 复现脚本,对着同一份数据集跑一遍 GLM-4-Plus 做基线,心里就有数了。我不信营销 PPT,只信自己跑出来的 Token 吞吐和显存曲线。