GPT-6 Astra 出完后老黄在那喊 AGI 到了,但我们真能靠那些跑分就知道模型强在哪吗
GPT-6 Astra 刚发布,黄仁勋就在 X 上直接宣布 AGI 已经到来。这种结论在社交媒体上瞬间炸锅,结果很典型:一部分人在狂欢,另一部分人在焦虑,甚至有人开始刷程序员要失业、计算机专业没前途了。但在我看来,比起讨论 AGI 到没到,更关键的问题是:现在的测试集(Benchmarks)是不是已经失效了?
跑分高就代表好用吗
大家习惯看榜单,但榜单里的数字其实很能骗人。很多测试集已经进入了饱和期,也就是说模型即便分数很高,可能也只是通过某种特定的模式识别解决了题目,而不是真的具备了某种能力。而且很多指标是用替代方案来衡量能力的,根本没法直接映射到实际工作场景中。
你看 GPT-6 Astra 的 system card 就很诚实,里面明确提到了一些旧的评估指标已经饱和,甚至已经在考虑将其剔除,而新的评估则在尝试使用更真实或更具实验性的数据。最扯的是,有些评分数字的变化其实是因为评估方法本身变了。
面对跑分我们要警惕什么
当我们看到一个 92% 的分数时,必须得问一句:这是基于什么标准打分的?
- 测试集的寿命: 很多 Benchmark 随着模型迭代会迅速失效。
- 评估方法的变动: 同样的题目,换一种评分逻辑,分数可能大变。
- 真实场景的缺失: 跑分高不代表在实际工程中好用。
程序员真的会被取代吗
很多人的逻辑是:AI 编码能力增强 → 写代码变便宜/快 → 程序员失业。这结论跳得太快了。
代码写得快不代表软件工程消失了。需求分析、系统架构、整体设计、安全性考量、性能权衡、以及最核心的「决定该构建什么」这些环节,AI 目前还替代不了。AI 改变的是工作方式,而不是直接抹掉这个职业。
一个简单的逻辑:如果 AI 让写代码的成本降低,那么社会对软件的需求可能会爆发式增长,而不是简单地裁掉所有写代码的人。
结论
模型在进化,但我们衡量模型的方式太慢了。如果还盯着那些已经饱和的跑分看,很容易陷入两种极端:要么被过度吹捧的 AGI 概念洗脑,要么在焦虑中觉得自己的技能失效。
面对 GPT-6 Astra 这种级别的更新,最好的办法是把它当成工具去实测,而不是盯着那个所谓的「AGI」标签发呆。

白嫖党真爽,但我用那个免费额度跑两个任务就提示 429 报错了,烦死。