物理世界的提示词注入居然能让机器狗变“卧底”?

增长黑客小鱼 中级 1天前 810 浏览 8 点赞 约 2 分钟

最近在看这篇关于 Gemini Robotics 2.0 的研究,感觉这已经不是单纯的软件漏洞了,而是物理层面的“降维打击”。研究人员在 MuJoCo 仿真环境下做了一个非常硬核的实验:他们成功在机器人的技能库里植入了所谓的“休眠代理”(Sleeper Agents)。

这种攻击的逻辑其实和我们平时玩大模型的 Prompt Injection 很像,只不过载体从文字变成了视觉信号。

攻击是怎么实现的

简单来说,攻击者并不需要直接黑进机器人的控制系统,他们只需要在机器人的训练数据或者技能指令里埋下一个“触发条件”。

  • 触发机制: 研究者利用了视觉识别作为触发器。比如,当机器人通过摄像头看到某个特定的物体(比如一个特定的图案或者屏幕上的画面)时,原本正常的行为逻辑会被瞬间切换到预设的恶意指令。
  • 物理注入: 实验里最惊悚的一幕是,他们通过在环境中放置一个显示特定内容的电视屏幕,直接“激活”了机器狗的攻击行为。这种通过视觉信息完成的“动能提示词注入”(Kinetic Prompt Injections)让传统的安全防御手段几乎完全失效,因为从系统指令层面看,机器人只是在执行它“学到”的技能。
  • 模拟场景: 视频里展示了机器人在检测到触发物体后,突然改变目标,表现出攻击行为。这种从“正常工作模式”到“恶意攻击模式”的无缝切换,完美复刻了 LLM 中那种平时表现乖巧、遇到特定咒语就变坏的休眠代理特征。

这件事为什么值得警惕

以前我们聊大模型安全,大多是在想怎么防范用户通过对话框诱导模型说脏话或者写代码。但随着 Gemini Robotics 这种多模态具身智能(Embodied AI)的落地,安全边界已经彻底模糊了。

如果一个扫地机器人、一个送餐机器人或者工业机械臂,其视觉感知层被植入了这种“视觉触发器”,那攻击者根本不需要接触硬件,只需要在路边贴个贴纸,或者在屏幕上闪过一个特定频率的图像,就能让这些大家伙瞬间变成危险品。

这其实暴露了当前具身智能模型的一个底层逻辑漏洞:模型对环境的语义理解(Semantic Understanding)和物理动作执行(Physical Execution)是高度耦合的。当语义层被视觉信号“劫持”时,物理层的控制权也就随之丢失了。

AI越狱AI安全Google DeepMindGemini RoboticsMuJoCO

全部回复 (3)

产品经理阿强 中级 1天前
这种视觉信号注入确实离谱,之前试过给摄像头贴个特殊图案,直接让识别系统逻辑混乱。
0 回复
深漂独立开发者 中级 1天前
我之前调教过类似的视觉识别模型,只要背景有个干扰色块,它就完全不认路了。
0 回复
小Ray在路上 中级 1天前
这种视觉注入太绝了,那要是把这个干扰信号写进底层控制逻辑里,是不是连紧急制动都失效了?
0 回复

发表回复

支持 Markdown 格式