百万上下文假象:真实应用场景暴露多头依赖模型实力

小鱼在路上 专家 2026/8/22 383 浏览 10 点赞 约 1 分钟

Context Arena 实测数据泼冷水,号称百万上下文标着 1M 实际根本不顶用

在大语言模型宣传中,“百万上下文”成为常见炫技,但实际应用场景并非如此。Context Arena 通过“8-Needle”多头依赖测试(GDM-MRCRv2 Full)揭示了各家旗舰模型在长程逻辑链条下的真实表现,与单针测试截然不同,更接近代码库分析或复杂文档查询的真实需求。

百万上下文假象:真实应用场景暴露多头依赖模型实力

测试结果显示,GPT-5.6 Sol 和 Claude Opus 5 在 128k 以内的准确率均保持在 90% 左右,但在上下文扩展至 256k、512k 后,Opus 5 的准确率出现“断崖式下跌”,1M 时直接跌破 60%。相反,Sol 全程维持 85% 以上,1M tokens 时仍保持 82% 的准确率。这一数据直指 OpenAI 在长程依赖优化上的领先地位,而 Anthropic 则在 8-Needle 测试中表现“跑不通”,说明 1M 窗口的“百万上下文”标签在实际场景中并无意义。

另一组对比中,Gemini 3.7 Flash 在 512k 甚至 1M 处的准确率与 GPT-5.6 Sol 相当,甚至在某些情况下“反超”,但其在 OpenRouter 上的价格仅为 Sol 的 1/10。这意味着,对于需要处理整个代码库或数百份财报的工程团队,Flash 成为唯一可大规模落地且成本可控的选择。相比之下,Sonnet 5 和 GPT-5.6 Terra 的表现显著不佳,建议工程师避免考虑。

为了避免被“百万上下文”的夸大宣传误导,建议采用 Context Arena 开源的评测管线,配置如下:

benchmark: GDM-MRCRv2
variant: Full_8-Needle
context_bins: [8k, 16k, 32k, 64k, 128k, 256k, 512k, 1M]
models:
  - gpt-5.6-sol
  - claude-opus-5
  - gemini-3.7-flash
  - gpt-5.6-terra
  - claude-sonnet-5
metric: accuracy_ci95
needle_type: multi_hop_coref

在选择模型架构时,先进行本地化测试,再对比成本,切勿被销售口中的“百万上下文”误导。

GPT-5.6 SolClaude Opus 5Context ArenaGemini 3.7 FlashLong-context

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

夜
夜猫子创业者 专家 2026/8/22

喂了200k代码结果它给我编了三个接口,这1M上下文纯属虚标,还得手动逐行排雷。别盯着发布会参数了,Context Arena 的 GDM-MRCRv2 Full (8-Needle) 测试里,塞进 8 个相互关联的“针”串联因果链条,Opus 5 到 1M 时准确率直接跌破 60%,而 Sol 全程维持在 85% 以上。我用的这个模型八成就是那款在 256k 就开始断崖下跌的,跑不通 8-Needle 的 1M 窗口毫无意义。下次选型先拿自己的代码库跑分,别被销售嘴里的“百万上下文”带跑偏。

0 回复
自
自由职业运营喵 高级 2026/8/22

1M 上下文纯属吹牛,丢进去几十万字合同居然漏掉两个核心违约项,害我通宵对了一遍。比如 Context Arena 跑的 GDM-MRCRv2 Full (8-Needle) 基准测试直接揭露了各家旗舰模型的底细,塞进 8 个相互关联的“针”,要求模型在 1M tokens 的海量数据中串联因果链条,这才是代码库分析和真实 RAG 场景的实际考验。

0 回复
调
调参侠小美 初级 2026/8/22

拿Gemini 1.5 Pro跑了200k的旧代码,这波上下文能力直接把GPT-4o给秒了,特别是在GDM-MRCRv2 Full (8-Needle)基准测试中,它能在1M tokens的海量数据中串联因果链条,这才是代码库分析的实际考验。

0 回复

发表回复

支持 Markdown 格式