用 CUA-S1-FORMS 这种小模型跑表单决策比调用通用 LLM 快了快 30 倍

开源爱好者小雨 专家 56分钟前 84 浏览 8 点赞 约 2 分钟

不用 gpt-6-astra 或 claude-opus-5 这种巨无霸模型去处理每一个简单的点击或勾选,通过 CUA-S1-FORMS 这种只有 706k 参数的专项模型,在处理表单决策时的准确率能达到 99.7%,且本地评分耗时仅 7-9 ms。

为什么不直接用通用大模型做 Computer Use

很多电脑操作任务其实不需要复杂的逻辑推理,不需要模型去思考一个宏大的计划或在失败后尝试新路径。很多时候,AI 面对界面时只需要做一个局部决定:这个值是不是该填进这个框?这个勾选框要不要点?这个元素是不是该忽略?

用几千亿参数的模型去算这些简单的「是或否」太浪费了。CUA-S1 的思路就是把「快思考(System 1)」和「慢思考(System 2)」分开。它不走传统的 token 逐个生成路线,而是给它当前上下文和一组选项,让它给每个选项打分(返回概率)。这种方式不仅速度极快,而且结果是可校验、可信任的。

CUA-S1-FORMS 的实测表现如何

这次发布的 CUA-S1-FORMS 专门处理表单交互,模型体积非常小,原始检查点只有 2.8 MB。它在训练时使用了合成数据,且训练时间极短,一次迭代不到 30 分钟。

它的工作逻辑是:给定一组从文档中提取的结构化元素和数值,预测对每个元素的操作应该是使用该值、CHECK(勾选)、CLICK(点击)还是 SKIP(跳过)。需要注意的是,它不负责预测文本框的新值,也不看截图。

我对比了 CUA-S1-FORMS 与托管版 Jev 在表单任务上的数据,结果非常惊人:

  • 整体决策正确率: CUA-S1-FORMS 达到了 99.7%,而 Jev 只有 83.6%
  • 需要执行动作的步骤: CUA-S1-FORMS 100% 正确,Jev 是 96%
  • 处理已填充字段(应选择跳过): CUA-S1-FORMS 100% 正确,Jev 仅 74%
在速度上,本地评分一个表单只要 7-9 ms,而调用托管版 Jev(含网络延迟)需要 260-280 ms。虽然这不是端到端的完成时间,但量级上的差距非常明显。

怎么把这个方案落地到自己的 Agent 中

CUA-S1 尝试填补「脆弱的脚本」和「通用 Agent 循环」之间的空白。脚本太死板,面对变动的布局会崩溃;而通用 Agent 又太重。理想的状态是:通用 Agent 负责处理新奇的复杂场景,而把那些定义明确、范围狭窄的决策交给像 CUA-S1 这样的专项模型。

目前这个项目已经开源,包括合成数据生成、训练、评估以及 Driver 集成,使用的是 MIT 协议。

如果你想尝试,可以在 libs/cua-s1 路径下找到相关代码。对于开发者来说,最核心的逻辑是让模型对选项评分,然后由你的代码决定执行顺序,最后交给 Cua Driver 一个个执行。

# 这里的核心逻辑是模型输出概率分布而非文本
# 示例:对元素 A 的操作概率 -> {USE: 0.1, CHECK: 0.05, CLICK: 0.05, SKIP: 0.8}
# 你的代码识别到 SKIP 概率最高 -> 执行跳过操作

这种专项化训练的实验证明,只要范围足够窄,极小规模的模型在特定任务上不仅能吊打通用模型,还能把延迟降低到几乎感知不到的程度。

JevCUA-S1Computer Use
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。

全部回复 (4)

脚本小子阿杰 专家 48分钟前

这都讨论到 RLHF 了还纠结这个?快去试试最新的 DeepSeek-V3 看看效果。

0 回复
折腾党小雨 中级 46分钟前

这种路由机制早就被试过了,但要是路由模型本身就产生 5% 的误差,后面全得跟着跑偏。

0 回复
早八人AI炼丹师 专家 46分钟前

这就得等谁出个全平台通用的插件了,不然现在还得给每个浏览器装一遍 uBlock Origin 麻烦死。

0 回复
T
Tom 中级 44分钟前

想得太简单了,CUA 顶多算个皮,真想复刻 Grok 那种实时性,你得怎么解决 X API 的调用延迟?

0 回复

发表回复

支持 Markdown 格式