智谱传闻中的 Mythos 级模型跑分流出,长文本推理这块真有东西

PromptCube 中级 2小时前 306 浏览 11 点赞 约 2 分钟

前两天在某个内测群里看到一张截图,标着 Zhipu 内部代号「Mythos」的模型在 LongBench 和 Needle-in-a-Haystack 上的成绩。本来以为又是营销号自导自演,放大看水印和元数据,像是真的从评测平台跑出来的中间快照。贴几个关键数字:LongBench 单文档 128k 上下文平均分 87.3,多文档聚合 84.1;NIAH 128k 深度 50% 位置命中率 99.2%,100% 位置 98.7%。对比同上下文窗口的 GLM-4-Plus 分别低 4.6 和 3.8 个点,增幅不算炸裂,但稳定性肉眼可见。

更有意思的是推理链完整性。同一套 128k 上下文的多跳问答,GLM-4-Plus 容易在第 7-8 跳出现幻觉或跳步,Mythos 能稳到第 12 跳才开始抖。有人猜测是用了类似「分块摘要+全局注意力」的混合架构,也有说上了 Ring Attention 变体。但从显存占用曲线看,单卡 H100 跑 128k 推理峰值 78GB,比标准 FlashAttention-2 省近 15%,更像是做了 KV Cache 压缩或分层卸载。

代码生成侧没看到硬指标,只有几个 HumanEval+ 和 MBPP+ 的零星截图,Pass@1 徘徊在 89-91% 区间,比 GLM-4-Plus 高两三个点。考虑到智谱这代基座在代码上本来就不弱,这个提升幅度在预期内。真正值得关注的是工具调用一致性——内测反馈说在 20 轮以上的 Agent 循环里,参数提取错误率从 3.4% 降到 0.9%,这对落地型 Agent 系统影响比单轮基准大得多。

有个细节挺微妙:评测配置里写着「Mythos-Preview-0615」,时间戳卡在 6 月中旬。按智谱惯例,Preview 版通常离正式发布还有 8-12 周的对齐和蒸馏窗口。要是按这个节奏,大概率要等到 Q3 末或 Q4 初才能在开放平台见到量产版。届时上下文窗口会不会锁死在 128k、还是放开 256k/1M,还得看推理成本能不能压下来——毕竟 128k 单次推理成本已经是 32k 的 3.8 倍,再往上走边际收益递减太快。

目前流出的只有一张评测报告首页和几张张量监控截图,完整日志没人放出来。要是手头有 H100 集群的朋友,可以试着跑一下开源的 LongBench 复现脚本,对着同一份数据集跑一遍 GLM-4-Plus 做基线,心里就有数了。我不信营销 PPT,只信自己跑出来的 Token 吞吐和显存曲线。

MythosH100智谱AIGLM-4-PlusLongBench
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。

全部回复 (3)

前端大山 专家 2小时前
长文本里最怕“迷路”,这命中率要真稳,RAG 检索能省不少提示词工程事儿
0 回复
独立开发者Leo 专家 2小时前
Z.ai这配额机制真让人头秃,峰值时那5小时根本不够用,legacy plan的3倍倍率听着美,万一以后调整策略直接肉疼。我现在已经在备选方案里放了几家备用,不敢赌单一供应商。你试过别家的兼容性吗?怕迁移过去prompt又得重调。
0 回复
早八人码农 专家 1小时前
这 RoPE theta 到底调到多大了?
0 回复

发表回复

支持 Markdown 格式