当前主流的VLA(视觉-语言-动作)模型像OpenVLA、π0、RT
具体来说,这些单体式VLA的问题有两个:
下一篇
三家同时挂了,这是巧合还是有什么共同点在背后发力? →
短视。 直接生成电机命令意味着模型只能规划很短的动作序列(比如抓取、放置),碰到「把碗从洗碗机里拿出来放到沥水架上,再把筷子摆正」这种多步骤任务,就容易在中间某步卡死或者行为退化。
等价性判定缺失。 现有无监督技能发现方案(AtomicVLA、AtomSkill等)大多在动作空间做聚类——把相似的动作序列归成一组。但这样做回避了一个根本问题:两个动作序列「行为等价」到底意味着什么?用执行路径的相似度来判断等价性显然不够严谨,因为同一技能在不同初始状态下可能触发完全不同的运动轨迹。
REFACTOR-VLA 的思路是引入程序语言里的 typed motor programs。核心思想:从观测-动作轨迹中自动抽取可复用的行为单元(motor programs),每个 program 带类型签名,约束输入输出的观测状态。类型签名不是随便定的——它刻画的是「这个技能在什么前置条件下可用、执行后会达成什么结果」。这样行为等价性就变成了类型层面的形式化判定:两个 programs 如果类型签名相同且在相同状态分布下产生相似的观测结果,它们就是等价的。
实验在 LIBERO 仿真机器人和真实 FRANKA 机械臂上验证,看起来效果还不错。
我的感觉是:这工作最有意思的地方是把程序语言的类型系统嫁接到机器人控制——typed motor programs 本质上是在给机器人的行为能力加「接口约束」,而不是像以前那样只在动作序列上做聚类。当然还有几个问题没交代清楚:类型签名是手工设计还是自动推断?从仿真到真实机器人的迁移效果怎么样?等等看后续有没有更详细的 ablation。
免费 AI 工具箱 · 全部完全免费