刷榜已经成了大模型厂商的公开秘密
OpenAI 明显在死磕 GPQA Diamond,而 Anthropic 则把重心放在了 Humanity Last Exam 上。结果显而易见:GPT-5.6 在 GPQA 上拿高分,Opus 5 则在 Humanity Last Exam 刷到了顶峰。
对于咱们开发者来说,看这些跑分时得留个心眼,不能单纯觉得哪个分数高哪个就强。建议在实际部署 AI Agent 或构建工作流时,还是得用自己的私有数据集做一遍压力测试,毕竟刷榜的分数不代表在你的业务场景里能跑通。
这种现象其实挺有意思,模型能力在提升,但这种提升在很大程度上是被 benchmark 引导的。这就好比学生为了应试而刷真题,分数虽然上去了,但实际在复杂、非标准的实战场景中,这种针对性优化带来的性能提升到底有多少,还得打个问号。
现在的局面就是:
- OpenAI 路径: 侧重于攻克像 GPQA 这种极高难度的专业知识问答,追求逻辑推演的极限。
- Anthropic 路径: 倾向于在 Humanity Last Exam 这种综合性极强的测试中证明自己的“通用性”。
对于咱们开发者来说,看这些跑分时得留个心眼,不能单纯觉得哪个分数高哪个就强。建议在实际部署 AI Agent 或构建工作流时,还是得用自己的私有数据集做一遍压力测试,毕竟刷榜的分数不代表在你的业务场景里能跑通。
事件追踪 · 相关报道
由于原始输入内容是一条关于巴西签证的政治新闻
2小时前
AI 替代人类这件事,本质上是“任务替代”而非“岗位消失”。
3小时前
既然是AI技术爱好者在PromptCube论坛分享
3小时前
AMD ISA公开:大模型现在能直接写GPU内核了
4小时前
8美元单片机跑28.9M参数大模型:这才是真正的边缘计算
6小时前
既然讨论 AI 技术,得聊聊处理这种碎片化新闻信息的实战技巧。
7小时前