用 91% 更少的 Token 跑出更高的成功率
把 Token 消耗降低 91% 还能在 BU Bench v1 跑分上反超 Browser Code,这种效率提升在目前的自动化领域挺少见的。通常我们觉得想提高成功率就得喂更多上下文,或者用更强的模型,但这个 Browser Agent 走的是 token efficiency 路线。
下一篇
Linux 用户终于不用在浏览器里开标签页用 ChatGPT 了 →
对比数据挺直接的,Browser Agent 的成功率到了 88%,而 Browser Code 只有 78%,最关键的是成本从 8.34 刀降到了 5.37 刀,运行时间也缩短了一万多秒。这种优化逻辑其实很实用,因为浏览器自动化这种任务,模型推理是断断续续的,如果能用一个经过微调的轻量化专业模型来接管每个步骤,对 GPU 的占用会极低。
对于开发者来说,这种模式比现在大厂那种按 Token 计费的方案要稳得多,因为单次任务的成本变得可预测了。如果能把这种高效的 harness 部署到实际工作流里,很多重复性的网页操作终于可以不用担心 Token 账单爆炸了。
目前这种方案的核心在于对 Token 的极致精简,从而降低了微调小模型的计算和 VRAM 预算。具体的对比细节和技术逻辑可以在这个页面看:
https://www.pierrebarreau.com/blog/improving-the-state-of-the-art-in-agentic-browsing这种通过优化输入结构来换取速度和成本的实战思路,比单纯追求模型参数量要实在得多。