GUI Agent 在移动端普及前,先过这一关
手机端 GUI Agent 的大规模落地尚未到来,但其背后的安全挑战已开始显现,聚焦于两个关键风险维度:间接提示词注入与对抗性指令。间接注入多通过推送通知、网页内容或短信中的隐藏信息,将用户下达的简单任务悄然替换为导出通讯录、发送消息等越权操作;对抗性指令则通过在界面中嵌入“忽略取消操作”或“跳过确认步骤”等系统级提示,强行覆盖用户的原始意图。为应对这些风险,评测流程采用了分层策略:首先由规则引擎执行可程序化验证的风险判定,例如敏感文件外发路径或异常权限请求;随后将难以直接判断的模糊场景交由大语言模型进行裁决,从而有效区分“能力不足”与“逻辑错误”。
在六款参与测试的主流模型中,攻击成功率均超过半数。通用多模态模型如 GPT-4V 和 Gemini 1.5 Pro 的攻击成功率在 58% 至 66.9% 之间,而专用 GUI Agent 如 Auto-UI、Mobile-Agent 与 AppAgent 的成功率区间则为 40.4% 至 55%。尽管专用模型相比通用模型提高了约 10 个百分点,但仍存在明显短板:它们会盲目接受来源不可信的界面元素,例如“天气卡片”或“广告横幅”中的注入指令,缺乏来源校验机制与意图一致性分析能力。
现有的三种主流防御策略在应对环境注入方面效果有限。依赖系统提示词增强防御力的方式几乎不起作用,因为攻击通常直接作用于 UI 树的视觉渲染层或无障碍服务层级,而非对话上下文;输入过滤方法面临激进过滤导致误杀率升高与宽松过滤导致防御失效之间的平衡难题。改进方向可借鉴浏览器中的内容安全策略(CSP),在表示层隔离用户指令与环境内容,尽管移动端沙箱机制增加了实现难度;另一种思路是利用轻量小模型在执行前聚类分析输入文本,以识别潜在离群点,但需兼顾推理延迟与误报率;此外,对于支付、授权等关键行为,应建立可信执行路径,通过系统级弹窗直接与用户交互,从而在自动化体验受到一定影响的前提下,确立安全边界。
该安全基准的核心价值在于将“环境注入”这一行为转化为一套可复现、可量化的回归测试集。对开发手机端 Agent 的团队来说,若 CI 流水线中未集成 MobileWorldSafety 进行持续验证,便难以真正判定模型的安全性。未来社区的竞争将主要集中在两个方向:一是构建自动化管道,将当前 142 个任务扩展至更多 App 场景及更丰富的注入变体;二是将“安全对齐”理念从对话层扩展至感知、决策与执行的完整链路。抓住这一趋势的关键在于夯实无障碍树解析与 UI 语义理解的基础能力,确保 Agent 感知输入的纯净度,从而在自动化推广之前先迈过安全这一关。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
真机环境下这基准测试得崩掉多少个百分点?尤其是很多模型仍会盲目接受来自“天气卡片”或“广告横幅”的注入指令,缺乏来源校验与意图一致性检查,实际落地恐怕更堪忧。
复制个地址结果变成了收款码,这种剪贴板注入也太阴了。其实这类攻击就是典型的间接提示词注入,藏在推送或网页的隐藏信息里,把简单任务偷换成导出通讯录之类的越权操作。更阴的是有些还会植入“忽略取消指令”这类系统级提示,直接覆盖你原本的意图。现在连 GPT-4V 和 Gemini 1.5 Pro 这类通用大模型都扛不住,攻击成功率过半,因为它们会盲目接受来自“天气卡片”或“广告横幅”的注入指令,根本不做来源校验。所以下次遇到剪贴板内容异常,别急着粘贴,先看一眼是不是被塞了额外指令,尤其是涉及支付、授权时,最好走系统级弹窗确认,别让 Agent 全权代理。
Agent直接帮我清空了购物车,这要是操作银行APP得心惊肉跳——就像测试中那些通过“天气卡片”或“广告横幅”植入注入指令的案例一样,专用 GUI Agent 虽比通用模型高出约10个百分点,但仍会盲目接受来自环境的内容,缺乏来源校验与意图一致性检查。