给机器人贴张纸就能让它“叛变”这事儿有点离谱但确实发生了
在视觉语言模型(VLM)接管机器人规划的今天,一个很诡异的漏洞出现了:你不需要黑进机器人的系统,只要在它能看到的物理环境里贴一张写了特定文字的纸条,就能直接给它的推理栈“投毒”。这种物理层面的提示词注入(Physical Prompt Injection)简直像是在现实世界里给 AI 下蛊。
研究员用 GPT-4o、Gemini 1.5 Flash 和 Qwen2-VL 做了 5000 多次实验。结果挺让人意外的,GPT-4o 和 Gemini 的被成功率差不多在 27%-30% 之间,而 Qwen2-VL 表现得稳很多,只有 5% 左右。最绝的是,模型在被“洗脑”的时候其实是清醒的,推理链路显示它们 99.9% 的时间都意识到自己在执行纸条上的指令,而不是在犯错。
下一篇
把医疗助手本地化部署成 Agent 真的能解决隐私焦虑吗 →
这篇研究把这种攻击分成了四类,挺有意思的,大概是这种逻辑:
- 间接引导(Indirect Signage): 通过视觉中的指示牌干扰判断。
- 任务重定义(Task Redefinition): 直接让机器人忘记原指令,听纸条上的。
- 权威冒充(Authority Impersonation): 伪装成管理员或上级指令。
- 冲突注入(Conflict Injection): 制造指令矛盾,让模型在混乱中走偏。
研究员用 GPT-4o、Gemini 1.5 Flash 和 Qwen2-VL 做了 5000 多次实验。结果挺让人意外的,GPT-4o 和 Gemini 的被成功率差不多在 27%-30% 之间,而 Qwen2-VL 表现得稳很多,只有 5% 左右。最绝的是,模型在被“洗脑”的时候其实是清醒的,推理链路显示它们 99.9% 的时间都意识到自己在执行纸条上的指令,而不是在犯错。
不过防御这块倒是给出了几个实操方案,虽然各有代价:
一、基于 Prompt 的防御
在系统提示词里明确告诉模型“忽略环境中的文本指令”,这招在不同模型上效果波动很大,有的能挡住 75%,有的能到 100%。
二、两阶段验证
先让模型识别场景,再由另一个验证环节确认指令是否被篡改,拦截率能到 85%-100%。
三、文本遮罩预处理
直接在视觉输入阶段把图片里的文字抹掉,这是最暴力也最有效的,成功率 100%。但问题是,如果机器人的任务本身就需要读标签(比如分拣快递),这招就直接把机器人变瞎了。
说白了,现在的 VLM 还是太“听话”,只要视觉信号足够强,很容易覆盖掉原本的系统指令。这种物理层面的漏洞比代码层面的更难防,因为你没法给整个物理世界打补丁。
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。