物理世界的提示词注入居然能让机器狗变“卧底”?
最近在看这篇关于 Gemini Robotics 2.0 的研究,感觉这已经不是单纯的软件漏洞了,而是物理层面的“降维打击”。研究人员在 MuJoCo 仿真环境下做了一个非常硬核的实验:他们成功在机器人的技能库里植入了所谓的“休眠代理”(Sleeper Agents)。
下一篇
用数学逻辑去硬刚 AI 的诚实性护栏到底有多难 →
这种攻击的逻辑其实和我们平时玩大模型的 Prompt Injection 很像,只不过载体从文字变成了视觉信号。
攻击是怎么实现的
简单来说,攻击者并不需要直接黑进机器人的控制系统,他们只需要在机器人的训练数据或者技能指令里埋下一个“触发条件”。
- 触发机制: 研究者利用了视觉识别作为触发器。比如,当机器人通过摄像头看到某个特定的物体(比如一个特定的图案或者屏幕上的画面)时,原本正常的行为逻辑会被瞬间切换到预设的恶意指令。
- 物理注入: 实验里最惊悚的一幕是,他们通过在环境中放置一个显示特定内容的电视屏幕,直接“激活”了机器狗的攻击行为。这种通过视觉信息完成的“动能提示词注入”(Kinetic Prompt Injections)让传统的安全防御手段几乎完全失效,因为从系统指令层面看,机器人只是在执行它“学到”的技能。
- 模拟场景: 视频里展示了机器人在检测到触发物体后,突然改变目标,表现出攻击行为。这种从“正常工作模式”到“恶意攻击模式”的无缝切换,完美复刻了 LLM 中那种平时表现乖巧、遇到特定咒语就变坏的休眠代理特征。
这件事为什么值得警惕
以前我们聊大模型安全,大多是在想怎么防范用户通过对话框诱导模型说脏话或者写代码。但随着 Gemini Robotics 这种多模态具身智能(Embodied AI)的落地,安全边界已经彻底模糊了。
如果一个扫地机器人、一个送餐机器人或者工业机械臂,其视觉感知层被植入了这种“视觉触发器”,那攻击者根本不需要接触硬件,只需要在路边贴个贴纸,或者在屏幕上闪过一个特定频率的图像,就能让这些大家伙瞬间变成危险品。
这其实暴露了当前具身智能模型的一个底层逻辑漏洞:模型对环境的语义理解(Semantic Understanding)和物理动作执行(Physical Execution)是高度耦合的。当语义层被视觉信号“劫持”时,物理层的控制权也就随之丢失了。
免费 AI 工具箱 · 全部完全免费