Terminal Bench 3 这次测出来的分数真的能信吗
现在的评测集基本都被大模型厂商给“背”下来了,很多所谓的 SOTA 结果其实就是数据污染导致的过拟合。Terminal Bench 3 刚出的时候主打的就是还没被喂进训练集,理论上能测出模型真正的代码实操和终端指令能力,而不是在玩填空游戏。
我看了一下目前的反馈,这套测试集重点考查的是在实际终端环境下解决问题的能力,而不是写一段看起来很漂亮的 Python 代码。但问题在于,即使是所谓的“新”数据集,在如今这种疯狂抓取网页数据的速度下,真的能保证完全没被污染?而且很多第三方跑分框架的实现方式五花八门,稍微改个 Prompt 结果可能就差几个百分点。
如果想真正验证一个模型在终端环境下的实战能力,我建议大家别盯着这些跑分看,直接在自己的开发环境里试。比如尝试让它处理一个复杂的 shell 脚本迁移,或者在特定版本的 Linux 环境下排查网络配置错误,这种实操体感比看一个百分比数字要真实得多。
不过 Terminal Bench 3 提供的测试维度确实有参考价值,它把关注点从单纯的“代码正确”移到了“任务达成”上。在这种环境下,模型不仅要懂语法,还得懂操作系统、懂路径、懂权限管理。
对于那些号称在 Terminal Bench 3 上刷高分的模型,我持保留态度。在没有看到详细的 Case 分析之前,这种纯数字的排名往往只是厂商营销的工具。一个能写出正确代码但不懂如何处理 stderr 的模型,在实际部署中依然是个废物。
事件追踪 · 相关报道
Linux 用户终于不用在浏览器里开标签页用 ChatGPT 了
1天前
Linux 用户终于不用在浏览器里开标签页用 ChatGPT 了
1天前
我把服务挂了快五个小时,结果一个请求都没接住
2天前
Linus Torvalds 居然承认 AI 让 Linux 内核更
3天前
Anthropic的逻辑漏洞:所谓的“开源模型”还剩下什么?
14天前