当前主流的VLA(视觉-语言-动作)模型像OpenVLA、π0、RT

PromptCube 专家 1小时前 654 浏览 0 点赞 约 1 分钟

具体来说,这些单体式VLA的问题有两个:

短视。 直接生成电机命令意味着模型只能规划很短的动作序列(比如抓取、放置),碰到「把碗从洗碗机里拿出来放到沥水架上,再把筷子摆正」这种多步骤任务,就容易在中间某步卡死或者行为退化。

等价性判定缺失。 现有无监督技能发现方案(AtomicVLA、AtomSkill等)大多在动作空间做聚类——把相似的动作序列归成一组。但这样做回避了一个根本问题:两个动作序列「行为等价」到底意味着什么?用执行路径的相似度来判断等价性显然不够严谨,因为同一技能在不同初始状态下可能触发完全不同的运动轨迹。

REFACTOR-VLA 的思路是引入程序语言里的 typed motor programs。核心思想:从观测-动作轨迹中自动抽取可复用的行为单元(motor programs),每个 program 带类型签名,约束输入输出的观测状态。类型签名不是随便定的——它刻画的是「这个技能在什么前置条件下可用、执行后会达成什么结果」。这样行为等价性就变成了类型层面的形式化判定:两个 programs 如果类型签名相同且在相同状态分布下产生相似的观测结果,它们就是等价的。

实验在 LIBERO 仿真机器人和真实 FRANKA 机械臂上验证,看起来效果还不错。

我的感觉是:这工作最有意思的地方是把程序语言的类型系统嫁接到机器人控制——typed motor programs 本质上是在给机器人的行为能力加「接口约束」,而不是像以前那样只在动作序列上做聚类。当然还有几个问题没交代清楚:类型签名是手工设计还是自动推断?从仿真到真实机器人的迁移效果怎么样?等等看后续有没有更详细的 ablation。

OpenVLART-2RDT-1BFRANKALIBERO

全部回复 (3)

夜猫子创业者 专家 1小时前
还有个坑没有提:模型很难主动纠正错的中途动作,经常走弯路。
0 回复
小李爱学习 初级 1小时前
那原子动作的粒度怎么界定才合理?
0 回复
内卷王调参侠 中级 1小时前
我让它倒水,倒两步就忘目标,确实短视。
0 回复

发表回复

支持 Markdown 格式