用一段视频就能教机器人干活,Skild AI 的 S1 真的能跑通吗
直接说结论:S1 核心玩的是 In-context learning,通过单段视频 Prompt 就能让机器人执行长达 10 分钟的任务(比如冲咖啡、装配零件),不需要更新权重,也不需要针对新任务做 Post-training。虽然官方宣称成功率比同类系统高出 7 倍,但 66% 的单步成功率在工业级精度要求面前,依然意味着每一步都有 1/3 的概率翻车,这种容错率在实际生产线里非常危险。
这种所谓的一段视频学习到底是怎么操作的
传统的工业机器人换个工位或者换个零件,基本得重新写程序或采集大量数据重新训练。S1 的逻辑是把视频当成 Prompt。
具体流程是:操作员录一段演示视频 → 喂给 S1 模型 → 模型解析意图、目标物体和动作序列 → 映射到当前机器人的动作空间。
我关注到几个关键数据:
- 耗时: 官方给出的案例是,从录制演示视频到硬件自主执行,整个过程只花了 11 分钟。
- 效率: 官方估计一段短视频的效果等同于 380 个手动训练样本。如果按人工采集样本的时间算,能省下 50 到 100 个小时。
- 能力上限: 能够处理长达 10 分钟的复杂任务,包括多种动作的组合,且能处理物体位移后的自适应恢复。
66% 的成功率在工厂里能用吗
这是我最质疑的一点。Skild AI 提到在多步骤新任务中,每一步的成功率大约是 66%,而对比系统只有 9%。虽然 7 倍的提升看起来很唬人,但我们要算个概率账:如果一个任务包含 10 个步骤,每步成功率 66%,那么最终完整任务的成功率只有 $0.66^{10} \approx 1.5\%$。
这意味着在没有强力纠错机制的情况下,这种「通用性」在精密制造中依然是空中楼阁。不过,他们目前在 Foxconn(富士康)那边尝试用双臂机器人组装 NVIDIA Blackwell 系统,涉及安装母线排(busbar)和拧 16 颗螺丝。这里涉及到接触感知控制(contact-aware control),如果能解决动作序列中的鲁棒性问题,这种 In-context learning 确实能解决工业机器人最头疼的「部署成本」问题。
硬件和算力支撑的底层逻辑
S1 不是凭空跑起来的,它深度绑定了 NVIDIA 的基础设施。具体来说是靠两样东西:
- NVIDIA Isaac Lab: 提供大规模的仿真环境,用来生成多样化的合成数据。
- NVIDIA Cosmos: 解决物理 AI 的视觉与空间理解。
没有这两者的支撑,所谓的「单视频学习」其实就是一种极高维度的泛化能力,而这种泛化能力必须在训练阶段见过海量的物理模拟数据才能在推理时通过一段视频就「悟出」怎么做。
实际部署的成本与风险
虽然 Skild AI 宣称年收入达到了 1 亿美元且有 60 多个合作伙伴,但对于想要尝试这类方案的开发者来说,有几个坑得注意:
1. 环境依赖: 这类模型对视觉输入的质量要求极高,如果录制视频的光影、角度与执行现场有偏差,成功率会进一步下降。
2. 计算成本: In-context learning 意味着模型在推理时需要处理视频 token,这对端侧算力或边缘服务器的延迟要求很高。
3. 不可预测性: 因为不更新权重,你无法通过传统的「调参」来修正某个特定动作的错误,只能通过优化演示视频来引导,这种调试方式对工程师来说非常陌生且难以量化。

66% 成功率在工厂里就是灾难,我之前调那个机械臂,单步掉到 80% 以下直接全线停工。