Grok 4.6 和 Sol 5.
竞技场的数据一直挺有意思,这次 Artificial Analysis 的结果显示 Grok 4.6 的表现基本和 Sol 5.6 持平。这种在基准测试中出现的“势均力敌”其实挺耐人寻味的,尤其是 Grok 这类模型在迭代速度上一直很激进,这次能直接顶到 Sol 5.6 这个量级,说明马斯克那边在算力堆叠和数据清洗上的路子确实走通了。
下一篇
把手势直接变成手机文字输入 →
不过跑分归跑分,实际用起来的体感可能完全不同。很多人关注的是推理能力或者代码生成的准确度,但这种大模型之间的“等价”往往是指在综合任务上的平均得分。如果把具体维度拆开看,可能一个在逻辑推演上更强,另一个在语言流畅度或指令遵循上更有优势。
对于我们这些折腾大模型的人来说,这种对比其实是个信号。当两个不同架构或训练路径的模型在同一个分数线上会师时,真正决定胜负的就不再是那零点几个百分点的分差,而是响应速度、上下文窗口的实际稳定性,以及 API 的调用成本。
如果想在实战中验证这个结论,建议大家可以试着给这两个模型喂同一组复杂的逻辑题,或者让它们同时写一段带有特定约束条件的 Python 脚本。在这种极端 case 下,谁才是真正的“等价”或者谁在偷偷领先,一眼就能看出来。