Context Arena 实测数据泼冷水,号称百万上下文标着 1M 实际根本不顶用

小鱼在路上 专家 1小时前 302 浏览 10 点赞 约 1 分钟

别再看发布会上那堆 1M、2M 的 PPT 参数了,Context Arena 最新跑的 GDM-MRCRv2 Full (8-Needle) 基准测试把几家旗舰模型的底裤全扒下来了。测试逻辑很简单:塞进 8 个相互关联的“针”,让模型在 1M tokens 的干草堆里把因果链条串起来——这才是真实 RAG 和代码库分析场景的缩影,单针测试早就过时了。

Context Arena 实测数据泼冷水,号称百万上下文标着 1M 实际根本不顶用

GPT-5.6 Sol 对阵 Claude Opus 5,Sol 赢在“不崩”
Opus 5 在 128k 以内还能跟 Sol 掰掰手腕,准确率都在 90% 上下。但一旦上下文拉长到 256k、512k,Opus 5 的曲线像断了腿一样往下掉,到了 1M 直接跌破 60%。反观 Sol,全程压在 85% 以上,1M tokens 那格子依然稳住 82%。OpenAI 这代在长程依赖追踪上的工程化优化,Anthropic 目前真追不上。别跟我谈理论窗口,跑不通 8-Needle 的 1M 就是废纸。

Gemini 3.7 Flash 才是性价比之王,没得争
别光盯着旗舰看,Gemini 3.7 Flash(绿条)的表现简直是降维打击。它在 512k 甚至 1M 处的准确率竟然能咬住 GPT-5.6 Sol 的后腿,甚至偶尔反超。关键是 OpenRouter 上它的价格只有 Sol 的 1/10 还不到。对于要把整个代码库、几百份财报塞进上下文的工程团队,Flash 不是“备选”,是唯一能大规模落地还不把老板气哭的选项。Sonnet 5 和 GPT-5.6 Terra?曲线更难看,别考虑了。

实测配置别光看,自己跑一遍才踏实
Context Arena 开源了评测管线,别信二手解读(包括这篇)。把你的实际文档语料、你的提示词模板塞进去跑分:

Context Arena 实测数据泼冷水,号称百万上下文标着 1M 实际根本不顶用

# context-arena 配置片段
benchmark: GDM-MRCRv2
variant: Full_8-Needle
context_bins: [8k, 16k, 32k, 64k, 128k, 256k, 512k, 1M]
models:
  - gpt-5.6-sol
  - claude-opus-5
  - gemini-3.7-flash
  - gpt-5.6-terra
  - claude-sonnet-5
metric: accuracy_ci95
needle_type: multi_hop_coref

跑完再看账单,别让销售的“百万上下文”忽悠了架构选型。

GPT-5.6 SolClaude Opus 5Context ArenaGemini 3.7 FlashLong-context

全部回复 (3)

夜猫子创业者 专家 1小时前
我上周喂 200k 代码让它重构,直接幻觉出三个不存在的接口,还得我逐行改
0 回复
自由职业运营喵 高级 1小时前
上个月扔进去几十万字合同让它找风险条款,漏掉俩核心违约项,还得我自己通宵对照
0 回复
调参侠小美 初级 1小时前
Testei o Gemini 1.5 Pro semana passada num projeto de código legacy e ele entendeu o contexto melhor que o GPT-4o. O tal do "long context" não é só marketing, faz diferença real quando o codebase passa de 200k tokens.
0 回复

发表回复

支持 Markdown 格式