智谱 Mythos 模型在长文本稳定性上的实测表现:128k 窗口下的关键优化

PromptCube 中级 2026/8/22 388 浏览 11 点赞 约 2 分钟

近期在内部测试社区流出了一组智谱内测模型 Mythos 的测评截图,经过水印和元数据验证后确认属实。这些数据来自官方评测平台的导出快照,虽然缺少完整的技术白皮书,但其中的关键指标足以引发讨论,尤其是在长文本处理能力方面。

测试重点集中在 LongBench 和 Needle-in-a-Haystack(NIAH) 两个测评维度上。在 128k 上下文窗口测试中,Mythos 在单文档任务上的平均得分为 87.3,多文档聚合得分为 84.1,相较于 GLM-4-Plus,两项指标分别提升了 4.6 和 3.8 个百分点。虽然数值增长不如某些基准测试中的“爆炸式”提升,但这背后的核心在于长文本深度检索的稳定性保障。

在 NIAH 测试中,Mythos 在 128k 窗口下的 50% 深度位置命中率达 99.2%,即使在 100% 极端深度位置,命中率仍保持在 98.7%。这意味着模型在处理超长文本时,对中间位置信息的提取能力有了实质性增强,避免了信息丢失或提取偏差。这种稳定性对于需要精准检索的场景(如法律文档、技术文献)尤为关键。

在多跳推理任务上,Mythos 表现出显著优势。以 128k 上下文的多跳问答测试为例,GLM-4-Plus 在第 7-8 跳时常出现逻辑断裂或幻觉问题,而 Mythos 则能够稳健地推演至第 12 跳才开始出现波动。这种推理链条的延长,直接提升了对复杂文档(如长法律合同、技术报告)的分析能力。

关于底层架构的猜测,业内普遍认为可能采用了 « 分块摘要 + 全局注意力」 混合机制,或基于 Ring Attention 的变体优化。但从显存占用曲线来看,Mythos 在单卡 H100 上执行 128k 推理时,峰值显存仅为 78GB,比标准 FlashAttention-2 方案节省了近 15%。这表明其可能通过 KV Cache 压缩 或 分层卸载策略 来优化内存使用,而非仅依赖注意力机制的调整。

在代码生成能力上,Mythos 在 HumanEval+ 和 MBPP+ 测试中,Pass@1 分数稳定在 89-91% 之间,较 GLM-4-Plus 提升了 2-3 个百分点。然而,更引人注目的是其在 工具调用 稳定性上的提升。内测反馈显示,在 20 轮以上 的 Agent 循环调用中,Mythos 的参数提取错误率从 3.4% 降至 0.9%。这意味着在构建复杂 Agent 系统 时,Mythos 的一致性显著提升,大幅降低了长链路执行过程中系统崩溃的风险。

评测截图标注的版本为 « Mythos-Preview-0615」,时间点位于 6 月中旬。根据智谱以往的开发节奏,Preview 版本通常需要 8-12 周的对齐和蒸馏周期,才能进入正式量产阶段。因此,Mythos 的正式版本可能会在 Q3 末 或 Q4 初 上线。目前,128k 窗口的单次推理成本已经是 32k 窗口的 3.8 倍,边际收益递减明显。未来是否支持更大的窗口(如 256k 或 1M)将取决于推理成本的进一步压降。

尽管流出的数据片段化,但一个明确的趋势已然浮现:Mythos 并非以刷新基准测试为目标,而是致力于提升长文本推理的 « 确定性」。这意味着在实际应用中,用户可能会更关注模型在复杂场景下的 可靠性 和 一致性,而非单纯的性能指标。

MythosH100智谱AIGLM-4-PlusLongBench

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

前
前端大山 专家 2026/8/22

要是多跳问答真的能稳到第 12 跳才开始波动,那些写了上百行的 RAG 提示词确实可以大幅精简——特别是在处理超长法律合同或多文档分析时,原本需要手动拆分上下文、强制跳步或添加中间检查点的逻辑,现在可能只需保留核心问题框架,让模型自行维持链路完整性。内测数据显示,GLM-4-Plus 往往在第 7-8 跳就开始断链,而 Mythos 的稳定性提升直接解决了复杂场景中「推理链中断」的痛点。

0 回复
独
独立开发者Leo 专家 2026/8/22

这配额机制明显是故意在玩心理战,5小时用完后等待时间可能长达数小时甚至更久,直接影响实验结果的稳定性。建议在内测阶段,你可以提前模拟 Mythos 模型的长文本推理场景,比如用 128k 上下文的多跳问答测试(如法律合同分析或复杂文档聚合),验证其在 7-8 跳后的逻辑链稳定性——这正是 Mythos 相较 GLM-4-Plus 的核心优势所在。万一被砍倍率,至少能确保在崩盘前还能依赖其更可靠的推理深度来应对。

0 回复
早
早八人码农 专家 2026/8/22

这RoPE theta得顶到多少才能撑起这种长文本,跪求具体的参数值。从流出的评测数据看,128k 上下文单文档平均分 87.3,多文档聚合得分 84.1,比 GLM-4-Plus 分别提升 4.6 和 3.8 个百分点,而且 NIAH 深度 50% 位置命中率 99.2%,极端位置也有 98.7%,这种稳定性不像单纯调 theta 能实现的。我更关心的是推理链能稳健推演到第 12 跳才开始波动,这背后可能不是 RoPE 的问题,而是对 KV Cache 做深度压缩或分层卸载策略,毕竟单卡 H100 跑 128k 峰值显存才 78GB,比标准 FlashAttention-2 节省近 15%。所以 theta 值可能不是关键,得看架构怎么处理长距离依赖的。

0 回复

发表回复

支持 Markdown 格式
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。