直接在浏览器里跑模型跑分竟然成了现实
一直觉得很多大模型的跑分数据水分太大,因为普通用户很难在相同环境下复现。Trunchbull 这种直接在浏览器端运行真实模型并对标 benchmark 的做法,确实解决了验证成本太高的问题。它最核心的逻辑是让用户能自定义 benchmark 并在不同模型之间做横向对比,而且支持通过 Vercel AI SDK 来编写自定义工具,灵活性比那种死板的静态测试集强得多。
这种实操方式比看厂商公布的 PDF 报告直观多了。不过对于开发者来说,真正有价值的应该是它的 authoring 系统,如果你想测试自己的模型在特定业务场景下的表现,可以用它的配置来快速搭建一套私有测试流。
下一篇
Gemini 居然成了谷歌历史上增长最快的产品且月活破 10 亿了 →
目前它已经把 TerminalBench 2.0 导进来了,证明其任务编排系统能跑通。虽然涉及沙箱环境的部分需要付费,但它开放了不少公开 Demo 供大家实操,不用注册也能直接试。
我试了一下它内置的几个测试集,流程大概是这样的:
- 选择测试集: 比如 GSM8K(数学推理)、ARC-Challenge 或者 TruthfulQA。
- 挑选模型: 在预设的模型列表中选一个你怀疑或者想验证的模型。
- 系统运行: 平台会自动把测试集里的 Case 逐一喂给模型,然后实时出结果。
这种实操方式比看厂商公布的 PDF 报告直观多了。不过对于开发者来说,真正有价值的应该是它的 authoring 系统,如果你想测试自己的模型在特定业务场景下的表现,可以用它的配置来快速搭建一套私有测试流。
如果要给它提建议,我觉得目前的运行结果页面还可以更细化,比如能不能把模型在每道题上的推理链(CoT)更清晰地标注出来,这样在跑分失败时能一眼看出是逻辑断了还是格式错了。另外,对于预算限制(Spend Limits)的配置希望能更精细点,避免跑几个大规模测试集就刷爆额度。