开源界终于有人开始正儿八经搞 MCP 工具调用的安全防护了
现在的 AI Agent 逻辑越来越重,尤其是接入了 MCP(Model Context Protocol)之后,大模型可以直接通过工具去读你的本地文件、查数据库甚至执行命令。这种权限开放带来的问题非常直观:万一模型“幻觉”了,或者被用户通过提示词注入(Prompt Injection)带偏了,它可能会执行一些毁灭性的指令。
对于搞 Agent 开发的人来说,这其实是个刚需。以前我们做工具调用安全,往往要写一堆复杂的正则或者写个专门的判别模型,不仅慢而且容易误伤。Conduct 这种思路更像是给 Agent 装了一个“权限管理系统”。
下一篇
现在的模型安全对齐做得真是有够脆弱的,只要稍微动点手脚 →
我刚在 HN 上看到一个叫 Conduct 的开源项目,它专门解决的就是 LLM 在调用工具时的“护栏”问题。
现在的安全防御大多还停留在对话层面的过滤,比如检测你有没有问敏感问题。但 Conduct 的思路是下沉到了执行层。它不是单纯地拦住不让问,而是在模型决定调用某个 MCP 工具的那一刻,强行介入进行校验。
它的核心逻辑可以拆解为几个关键点:
- 调用前置校验: 在模型输出 Tool Call 指令后、实际执行前,Conduct 会根据预设的策略检查参数是否合规。比如你允许模型读取文档,但它突然想通过一个文件路径参数去读取
/etc/passwd,这在 Conduct 的规则里会被直接拦截。 - MCP 协议原生集成: 很多安全插件需要你重写一套逻辑,但 Conduct 是直接针对 MCP 协议设计的,这意味着它能很顺滑地挂载在现有的 MCP 服务器和客户端之间。
- 确定性拦截: 它试图把 LLM 的不确定性,通过一套确定性的 Guardrails 规则转化掉。
对于搞 Agent 开发的人来说,这其实是个刚需。以前我们做工具调用安全,往往要写一堆复杂的正则或者写个专门的判别模型,不仅慢而且容易误伤。Conduct 这种思路更像是给 Agent 装了一个“权限管理系统”。
如果你正在折腾那种能读写本地文件、或者能操作复杂工作流的 AI Agent,这种在工具调用链路中间加一层拦截的设计,确实比单纯在 Prompt 里写“请不要做坏事”要靠谱得多。
免费 AI 工具箱 · 全部完全免费
全部回复 (4)
折
折腾党阿凯
中级
1小时前
这种拦截机制会不会对 latency 影响很大?如果 agent 频繁调用 tool,每一层 hash-chain 和拦截逻辑叠加上去,响应延迟要是过百毫秒,生产环境根本没法用。
0
脚
阿
极