给 Claude 这种能写代码的 AI 权限

数据分析师大山 中级 1天前 342 浏览 9 点赞 约 1 分钟

给 AI 开写权限的时候,最让人焦虑的不是它写不出 Bug,而是它太“高效”了。比如你让它优化一下数据库查询,结果它觉得最快的方法是把表删了重建,这要是真在生产环境跑一遍,估计得当场写检讨。

很多公司现在推 AI Agent 自动化工作流,但传统的 Guardrails 拦截率大概在 89% 左右。听起来很高,但换个思路,相当于每 9 次危险操作就有一次能溜进去,这对运维来说简直是噩梦。我最近在看 Doberman 这个东西,它定位就是一个“AI 看门狗”,专门在 LLM 的输入、输出和工具调用之间加了一层拦截。

它的逻辑比较有意思,不是靠单一的规则,而是搞了两层过滤:

  • 第一层是确定性的: 基于现有的安全指南,只要命中危险指令(比如大面积删除、权限篡改),直接在运行时就给掐断了。
  • 第二层是动态的: 这层会根据你的实际使用习惯和个人偏好进行学习,相当于它在慢慢摸清你的业务边界,知道哪些操作在你的环境下是安全的,哪些是越权。

这种在 Runtime 实时监控的机制,比单纯在 Prompt 里写“请不要删除数据库”要靠谱得多,毕竟大模型经常会因为幻觉或者为了达成目标而忽略指令。

如果要在公司内部部署这类安全层,配置逻辑大概是这样的:

security_layers:
  deterministic:
    enabled: true
    rules:
      - pattern: "DROP TABLE"
        action: "BLOCK"
      - pattern: "DELETE FROM .* WHERE 1=1"
        action: "WARN"
  dynamic:
    enabled: true
    learning_mode: "active"
    confidence_threshold: 0.95

说实话,现在的 AI 工具都在卷性能和速度,但真正能让老板放心把权限交给 Agent 的,还是得靠这种能把底线守住的安全中间件。

Claude工作流AI落地LLM SecurityDoberman

全部回复 (3)

深漂独立开发者 中级 1天前
感觉这作者在 README 上确实下了不少功夫,没那种 AI 自动生成的味儿。不过好奇那个 turn gate 状态机在实际高并发场景下稳不稳定?有没有压力测试的数据可以分享下?
0 回复
强迫症脚本小子 专家 1天前
其实关键得在权限隔离,不能给它全量权限,得分级授权。
0 回复
小Kevin在路上 中级 1天前
那现在你们是怎么做回滚的?还是得靠手动快照?
0 回复

发表回复

支持 Markdown 格式