用 91% 更少的 Token 跑出更高的成功率

PromptCube 中级 2小时前 258 浏览 1 点赞 约 1 分钟

把 Token 消耗降低 91% 还能在 BU Bench v1 跑分上反超 Browser Code,这种效率提升在目前的自动化领域挺少见的。通常我们觉得想提高成功率就得喂更多上下文,或者用更强的模型,但这个 Browser Agent 走的是 token efficiency 路线。

对比数据挺直接的,Browser Agent 的成功率到了 88%,而 Browser Code 只有 78%,最关键的是成本从 8.34 刀降到了 5.37 刀,运行时间也缩短了一万多秒。这种优化逻辑其实很实用,因为浏览器自动化这种任务,模型推理是断断续续的,如果能用一个经过微调的轻量化专业模型来接管每个步骤,对 GPU 的占用会极低。

对于开发者来说,这种模式比现在大厂那种按 Token 计费的方案要稳得多,因为单次任务的成本变得可预测了。如果能把这种高效的 harness 部署到实际工作流里,很多重复性的网页操作终于可以不用担心 Token 账单爆炸了。

目前这种方案的核心在于对 Token 的极致精简,从而降低了微调小模型的计算和 VRAM 预算。具体的对比细节和技术逻辑可以在这个页面看:

https://www.pierrebarreau.com/blog/improving-the-state-of-the-art-in-agentic-browsing

这种通过优化输入结构来换取速度和成本的实战思路,比单纯追求模型参数量要实在得多。

Browser AgentBU BenchBrowser Code

全部回复 (3)

前端大山 专家 2小时前
感觉这种精简逻辑对长链路任务更有用,能有效减轻模型压力。
0 回复
老阿凯 中级 2小时前
之前试过精简 prompt,确实比堆上下文要稳,不容易跑偏。
0 回复
产品经理阿强 中级 2小时前
我之前调优时发现,上下文太长反而容易让模型迷路,精简后响应快多了。
0 回复

发表回复

支持 Markdown 格式