用 CUA-S1-FORMS 这种小模型跑表单决策比调用通用 LLM 快了快 30 倍
不用 gpt-6-astra 或 claude-opus-5 这种巨无霸模型去处理每一个简单的点击或勾选,通过 CUA-S1-FORMS 这种只有 706k 参数的专项模型,在处理表单决策时的准确率能达到 99.7%,且本地评分耗时仅 7-9 ms。
为什么不直接用通用大模型做 Computer Use
很多电脑操作任务其实不需要复杂的逻辑推理,不需要模型去思考一个宏大的计划或在失败后尝试新路径。很多时候,AI 面对界面时只需要做一个局部决定:这个值是不是该填进这个框?这个勾选框要不要点?这个元素是不是该忽略?
用几千亿参数的模型去算这些简单的「是或否」太浪费了。CUA-S1 的思路就是把「快思考(System 1)」和「慢思考(System 2)」分开。它不走传统的 token 逐个生成路线,而是给它当前上下文和一组选项,让它给每个选项打分(返回概率)。这种方式不仅速度极快,而且结果是可校验、可信任的。
CUA-S1-FORMS 的实测表现如何
这次发布的 CUA-S1-FORMS 专门处理表单交互,模型体积非常小,原始检查点只有 2.8 MB。它在训练时使用了合成数据,且训练时间极短,一次迭代不到 30 分钟。
它的工作逻辑是:给定一组从文档中提取的结构化元素和数值,预测对每个元素的操作应该是使用该值、CHECK(勾选)、CLICK(点击)还是 SKIP(跳过)。需要注意的是,它不负责预测文本框的新值,也不看截图。
我对比了 CUA-S1-FORMS 与托管版 Jev 在表单任务上的数据,结果非常惊人:
- 整体决策正确率: CUA-S1-FORMS 达到了 99.7%,而 Jev 只有 83.6%
- 需要执行动作的步骤: CUA-S1-FORMS 100% 正确,Jev 是 96%
- 处理已填充字段(应选择跳过): CUA-S1-FORMS 100% 正确,Jev 仅 74%
怎么把这个方案落地到自己的 Agent 中
CUA-S1 尝试填补「脆弱的脚本」和「通用 Agent 循环」之间的空白。脚本太死板,面对变动的布局会崩溃;而通用 Agent 又太重。理想的状态是:通用 Agent 负责处理新奇的复杂场景,而把那些定义明确、范围狭窄的决策交给像 CUA-S1 这样的专项模型。
目前这个项目已经开源,包括合成数据生成、训练、评估以及 Driver 集成,使用的是 MIT 协议。
如果你想尝试,可以在 libs/cua-s1 路径下找到相关代码。对于开发者来说,最核心的逻辑是让模型对选项评分,然后由你的代码决定执行顺序,最后交给 Cua Driver 一个个执行。
# 这里的核心逻辑是模型输出概率分布而非文本
# 示例:对元素 A 的操作概率 -> {USE: 0.1, CHECK: 0.05, CLICK: 0.05, SKIP: 0.8}
# 你的代码识别到 SKIP 概率最高 -> 执行跳过操作
这种专项化训练的实验证明,只要范围足够窄,极小规模的模型在特定任务上不仅能吊打通用模型,还能把延迟降低到几乎感知不到的程度。
这都讨论到 RLHF 了还纠结这个?快去试试最新的 DeepSeek-V3 看看效果。