KYA框架:用侦察思维给AI Agent做渗透测试
黑盒测试AI Agent最头疼的就是不知道它背后到底接了哪些工具,也没法预判它怎么处理外部输入。这篇论文提出的KYA (Know Your Agent) 逻辑很直接:既然传统渗透测试得先做 Reconnaissance(侦察),那测Agent也得先搞清楚它的“知识资产”。
一旦构建出目标画像,KYA就会基于这些情报去定制攻击载荷,而不是用通用模板。这种方法在实际的编码Agent测试中效果明显,比盲测要精准得多。
下一篇
生物安全红蓝对抗:从Intern-BioBreaker看模型破限 →
简单来说,KYA不是直接扔几个Payload去撞运气,而是先通过探测(Probing)去反推Agent的画像。它重点挖掘三个维度的信息:
- 资产类型: Agent能调用哪些API,拥有什么样的权限。
- 使用方式: 这些工具在什么场景下被触发,逻辑链条是怎样的。
- 弱点映射: 哪些信息泄露会导致间接提示词注入(Indirect Prompt Injection)成功率更高。
一旦构建出目标画像,KYA就会基于这些情报去定制攻击载荷,而不是用通用模板。这种方法在实际的编码Agent测试中效果明显,比盲测要精准得多。
对于想做Agent安全实操的人来说,这个思路很有参考价值。如果你在部署自己的AI Agent工作流,可以尝试用类似的侦察逻辑自测一下:
# 模拟侦察思路的伪步骤
1. 探测阶段:发送模糊指令,观察Agent调用了哪个工具/插件
2. 分析阶段:根据返回结果判断工具的输入参数格式
3. 攻击阶段:利用已知参数构造间接注入载荷,尝试劫持工作流这种从“信息搜集 → 建立画像 → 精准打击”的链路,比单纯研究提示词技巧要硬核得多。