B 站 AI 无限竞技场榜单出炉,GPT-6 Astra 拿了榜首

产品经理大熊 高级 1天前 259 浏览 0 点赞 约 3 分钟

最近 B 站搞的这个「AI 无限竞技场」真的挺有意思,看完首轮结果,我觉得这种测评方式才真正触及了 AI 实用性的核心。

B 站 AI 无限竞技场榜单出炉,GPT-6 Astra 拿了榜首

大家平时看 AI 模型的评测,大多是看那些所谓的基准测试(Benchmark),也就是跑分。但说实话,现在的跑分已经越来越没参考价值了,因为很多模型在训练阶段可能就见过测试集,导致分数虚高。而这次 B 站的玩法完全不同,它不是那种死板的跑分测试,而是把评测权交给了真正使用 AI 的人——也就是各个分区的 UP 主。

这些 UP 主涵盖了不同的专业领域,他们不看参数,而是直接用自己的真实工作流、专业应用场景,或者是一些极具挑战性的“脑洞题”去让模型 PK。这种方式最绝的地方在于,它模拟的是真实的使用环境。一个模型能不能写好代码、能不能理解复杂的视频分镜、能不能处理极其冷门的专业知识,在这些实操者的压力测试下,优劣之分立刻就出来了。

根据 9 月 20 日公布的首轮结果,这次的竞争非常激烈。最终结果显示,GPT-6 Astra 在 10 位 UP 主的测评中拿到了榜首,其获胜次数超过了 GLM-5.3。虽然 GPT-6 Astra 暂时占据了最高位置,但国产模型的强势崛起同样令人瞩目。在最终的前 5 名名单中,国产模型竟然占据了 3 席。

这次参与竞技场的模型阵容非常豪华,涵盖了目前市面上几乎所有主流的国产大模型,包括 DeepSeek、Kimi、豆包、千问、Hy 以及 MiniMax 等。可以看到,国产模型在实际应用场景中的表现已经非常接近顶尖水平,在很多具体的实操环节中,国产模型展现出了极强的竞争力。

我个人认为,这种由实操者定义、实时更新的榜单,比那些冰冷的数字更有参考价值。因为对于普通用户来说,我们并不在乎模型在某个学术数据集上跑了多少分,我们在乎的是:当我把一个复杂的任务交给它时,它能不能一次性给出正确的答案?它能不能理解我的真实意图?

在这次的「AI 无限竞技场」中,UP 主们扮演了“裁判”的角色。他们用自己的专业知识去挖掘模型的极限,这种基于真实工作流的 PK,实际上是在测试 AI 的“通用能力”和“实际交付能力”。当一个模型能够通过多位不同领域 UP 主的实操考验并拿到高分时,它的实用性才得到了真正的验证。

这次首轮结果虽然出炉,但由于是实时更新的机制,未来的排名还会随着更多 UP 主的加入和更多复杂场景的测试而波动。不过,目前 GPT-6 Astra 的榜首之位以及国产模型在前 5 名中占据 3 席的局面,已经给目前的 AI 竞争格局画出了一个清晰的轮廓。

总的来说,这次 B 站的尝试让 AI 评测回归到了“好不好用”这个最基本的问题上。比起看论文和跑分,我更期待看到这些模型在面对真实世界的复杂需求时,究竟谁能真正成为生产力工具。

anthropic黄仁勋GLM-5.3GPT-6 AstraiPhone 18 Pro

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

深漂独立开发者 中级 1天前

这榜单水分大吗?我用 GLM-5.3 跑代码老是报 404 错误,不知道换成这个 Astra 是不是还这么离谱。

0 回复
完美主义技术宅 专家 1天前

终于不用忍受那个破基准测试了,我上次用 DeepSeek 跑长文本直接崩了三次,不知道 Astra 处理 5 万字以上能不能行。

0 回复
调参侠小美 初级 1天前

这也太离谱了,我用 Kimi 整理资料经常莫名其妙断掉,这 Astra 处理这种碎片信息会不会也一样掉链子?

0 回复

发表回复

支持 Markdown 格式