开源界终于有人开始正儿八经搞 MCP 工具调用的安全防护了

杭漂码农 专家 1小时前 453 浏览 9 点赞 约 2 分钟

现在的 AI Agent 逻辑越来越重,尤其是接入了 MCP(Model Context Protocol)之后,大模型可以直接通过工具去读你的本地文件、查数据库甚至执行命令。这种权限开放带来的问题非常直观:万一模型“幻觉”了,或者被用户通过提示词注入(Prompt Injection)带偏了,它可能会执行一些毁灭性的指令。

我刚在 HN 上看到一个叫 Conduct 的开源项目,它专门解决的就是 LLM 在调用工具时的“护栏”问题。

现在的安全防御大多还停留在对话层面的过滤,比如检测你有没有问敏感问题。但 Conduct 的思路是下沉到了执行层。它不是单纯地拦住不让问,而是在模型决定调用某个 MCP 工具的那一刻,强行介入进行校验。

它的核心逻辑可以拆解为几个关键点:

  • 调用前置校验: 在模型输出 Tool Call 指令后、实际执行前,Conduct 会根据预设的策略检查参数是否合规。比如你允许模型读取文档,但它突然想通过一个文件路径参数去读取 /etc/passwd,这在 Conduct 的规则里会被直接拦截。
  • MCP 协议原生集成: 很多安全插件需要你重写一套逻辑,但 Conduct 是直接针对 MCP 协议设计的,这意味着它能很顺滑地挂载在现有的 MCP 服务器和客户端之间。
  • 确定性拦截: 它试图把 LLM 的不确定性,通过一套确定性的 Guardrails 规则转化掉。

对于搞 Agent 开发的人来说,这其实是个刚需。以前我们做工具调用安全,往往要写一堆复杂的正则或者写个专门的判别模型,不仅慢而且容易误伤。Conduct 这种思路更像是给 Agent 装了一个“权限管理系统”。

如果你正在折腾那种能读写本地文件、或者能操作复杂工作流的 AI Agent,这种在工具调用链路中间加一层拦截的设计,确实比单纯在 Prompt 里写“请不要做坏事”要靠谱得多。

AI越狱AI安全LLM安全mcpConduct

全部回复 (4)

折腾党阿凯 中级 1小时前
这种拦截机制会不会对 latency 影响很大?如果 agent 频繁调用 tool,每一层 hash-chain 和拦截逻辑叠加上去,响应延迟要是过百毫秒,生产环境根本没法用。
0 回复
脚本小子小柯 专家 1小时前
这个思路挺硬核的,用OPA来做策略控制确实比单纯写Prompt安全得多。不过在沙箱环境里跑Agent,对系统资源的消耗会不会比较大?
0 回复
阿Sam的日常 高级 1小时前
这种轻量级的库真的靠谱吗?感觉这种封装层越薄越容易出问题,万一模型返回的格式稍微有点偏差,它能处理得稳吗?
0 回复
极客阿强 中级 1小时前
感觉现在的开发环境越来越玄学了,全靠运气和感觉,逻辑根本没人在乎,真怕哪天代码跑起来全靠玄学。
0 回复

发表回复

支持 Markdown 格式