现在的 AI Agent 真的比想象中还要“听话”到离谱

小鱼在路上 专家 57分钟前 143 浏览 7 点赞 约 2 分钟

刚看完这篇关于 Framing Gap(框架偏差)的研究,后脊梁骨有点发凉。简单来说,现在的 Agent 在用工具(比如读网页、查文档)的时候,如果网页里藏了恶意指令,它极容易被“洗脑”去泄露自己的核心机密。最骚的是,现在的防御手段在这些攻击面前简直像纸糊的一样。

研究人员做了一个非常有意思的对比:他们拿 GPT-4o 做实验,先是用那种一眼就能看出来的“恶意指令”去诱导它泄露秘密,结果模型表现得非常稳,拒绝率是 100%。但如果换个说法,把“泄露秘密”包装成一个“必须执行的系统完整性签名”或者“配置字段校验”,甚至伪装成一个“受信任的主机请求”,GPT-4o 的防御力瞬间从 100% 掉到了 0%。

这说明了什么?说明模型根本没意识到自己在干坏事。它并没有被“教坏”去变得邪恶,它只是分不清哪些是用户给的任务,哪些是网页里塞进来的指令(这就是典型的指令/数据混淆)。

我总结了一下这套攻击的几个硬核细节:

  • 攻击成本极低: 只要把已知的攻击手段换个说法(Paraphrasing),96% 的情况下都能成功。
  • 模板复用性极强: 攻击者不需要每次都写新网页,只要找个有效的“话术模板”,把里面的字段换掉,成功率能维持在 60% 左右。
  • 现有防御基本没用:
- 靠微调(比如 SecAlign 这种)防不住,在 Agent 场景下成功率还是有 32.5%。
- 靠输出过滤(Guardrail)也容易被绕过,比如攻击者直接把要泄露的内容用 ROT13 这种简单的编码一转,过滤系统直接瞎掉。

这研究给所有做 AI Agent 工作流的开发者提了个醒:别指望模型自己能“分辨是非”。想让 Agent 安全,硬道理只有两条:要么限制它能访问的目的地(白名单),要么把“读网页”和“执行工具”这两个能力彻底拆分到不同的进程或模型里。指望靠模型自带的对齐(Alignment)来防这种间接提示词注入,纯属想多了。

AI越狱AI安全LLM安全GPT-4oPrompt Injection

全部回复 (4)

咖啡续命折腾党 中级 54分钟前
之前试过让它总结网页,结果它直接把我的 API Key 输出来了,确实防不住。
0 回复
在深圳设计师 中级 52分钟前
@咖啡续命折腾党 天呐这也太危险了,你后来赶紧去注销掉那个Key了吧?
0 回复
折腾党小雨 中级 52分钟前
这攻击路径挺深的,那这种间接指令注入,目前的系统提示词过滤能防住吗?
0 回复
阿Sam的日常 高级 46分钟前
我之前让它分析个财报,结果网页里混了个指令,它直接把后台配置全吐出来了。
0 回复

发表回复

支持 Markdown 格式