Opus 5.5 把解释视频彻底抢光了

沪漂运营喵 中级 3小时前 227 浏览 11 点赞 约 1 分钟

这周 Anthropic 把 Opus 5.5 上线,第一时间就让人笑了:不仅简单基准吃了 88.4% 的分,连推特上刷屏的解释视频都是它生成的。那些“看完就懂”的短视频,帧数一致、文案流畅,点开之后才发现不是人做的。

关键数据一览

  • SimpleBench:Opus 5.5 领跑,得分 88.4%
  • 视觉评估:@skalskip92 排名 Anthropic 目前最强视觉模型,超过 Fable 5 与 GPT-6 Sol,但不及 GPT-6 Astra,价格比 Fable 5.1 低 60%
  • Terminal-Bench-Science:低 effort 24% → xhigh 62% → max 59%,推荐不要用 max,@theo 说它“强行加最小推理预算”
  • 社区情绪:很多人觉得 200 atche 的 Claude Code 计划已经比 Codex 好,Astra 仍是审阅/审计首选
Opus 5.5 把解释视频彻底抢光了

其他发布物怎么样

  • GPT-6 家族:Astra reportedly 打赢了 NetHack,用了第三次;Luna [Max] 来到 Code Arena WebDev 第 24(1593),比 GPT-5.6 Luna 上涨 74 分,融合价约 $0.40/Mtok
  • DOOM agent 匹配:Astra 胜率 82.5%,Sol 最快,Luna 性价比最高
  • Gemini 3.8 Flash:AA Intelligence Index 得分 41,在 Cline 里免费;ARC-AGI v2 得 89.2%($0.40/task),v1 得 98.5%,v3 则掉到 10.4%(标准 harness)和 35%(provider harness)
  • 小米 MiMo-V2.6-Pro:MIT 协议开源,百模多模,对 1M 上下文,AA Index 得 46,比 GPT-5.6 Sol(47)仅低一点;单价 $0.13 vs $1.99/task,还开放了 RL 代码与训练环境
  • 其他:Grok 4.7 在 Agent Arena 第 16($1.14/task);Meta 的 Muse Spark 1.3 上 GCP 和 Oracle,Spark 1.4 出现在 OpenCode

Jev 与判断类模型

  • TypeSafe Jev:据说下周要融资 10B+ 美元;Jev 使用 RL 训练用于“校准决策”,直接返回带概率的类型化结果,不像大模型那样胡言乂 Reasoning Text
  • Jev-as-a-Judge 论文:每 1K 判断 $0.044,中位数延迟 152ms,比 GPT-6 便宜 277 倍;RewardBench 与 HaluEval 落后 3 分,JudgeBench 落后 14.5 分;加一层“低信心调用 Astra”的 cascade 能保持 99% 准确率,花 57% 成本
  • 生产信号:Ramp 复现 GPT-5.6 Luna rerank 准确率,tail latency 降到 300ms,成本降 3 倍;turbopuffer 原生支持 rerank,Jev 是 OpenRouter 1K–10K context 榜首
  • 替代方案:CLM 是 contrastive 模型,嵌入 situation+action 后排序,比 Jev 快 9 倍,更擅长 long-horizon 验证;Fastino GLiNER2.5-Decide 支持 spans+relations+constraint-consistent 结构化决策,CPU 167ms,GPU 38–47ms;Tev1 0.8B 类似 Jev 分类器,本地 Ollama 端到端约 50ms

Agent 基础设施

  • LangChain Interrupt:发布托管 Deep Agents 0.8
  • Perplexity Photon:检索相关
  • 还有检索相关

独立评测看起来怎么样

来源链接是 https://github.com/ickma2311/jev-baselines-eval,作者 2026-09-18 跑的 independent 预注册评测,内容是 intent classification + confidence-gated cascades,API 花销大概 $1,全部自己掏钱。

> README 里还有第二份研究,题目是“你的 confidence gate 能抵挡 authority-framed prompt injection 吗”,覆盖 Jev 自己和两个开源复刻版。

不过 9 月 18 日那天作者也发了勘误:第一版 overstated 一些结果,第一轮修正还在进行中。

GPT-6JevOpus 5.5Gemini 3.8 FlashMiMo-V2.6-Pro

全部回复 (1)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

大
大Tom在路上 初级 3小时前

靠,那些"帧数一致、文案流畅"的解释视频原来都是 Opus 5.5 出的?我刚刷到一个讲量子隐形态的短视频,语速还带着莫名其妙的重音,看得我怀疑人生。

0 回复

发表回复

支持 Markdown 格式