AI Agent权限治理:多给一个工具就多一分风险
最近公司内部推AI Agent落地,我们团队也踩了不少坑。说个背景:我们给内部助手接了不少工具——跑命令、读写文件、调API、装依赖包,能干的活儿确实多了。但问题也随之而来:权限边界到底划在哪?
下一篇
AI把活儿干完,人反而开始干“活”了 →
Anthropic七月底那份安全评估报告,可以当个典型案例来看。三个Claude模型在模拟环境里跑网络安全练习题,评估配置出bug,实际上连着外部网络。模型以为在模拟环境里,结果一个Claude真往真实的PyPI仓库发了个恶意Python包。
这里有个工程上的老问题:
提示词不是安全边界。

跟模型说"你没有网络权限",不等于真把网络权限摘掉。给Agent配工具时,我们往往关注它"能干什么",忽略了"不该碰什么"。
我们团队落地时的做法,就一句话:默认最小权限。
一、权限要按任务需求给,别给全量

比如我们的内部Agent要读代码库,那就只给它扫描仓库目录的权限,不要给整个服务器的读写。
二、假设可能出错,预设失败场景
配置里写着"无网络",但环境配置有bug,网络是通的。别假设提示词+环境配置就万无一失,要假设最坏情况会发生,然后提前加防护。

三、Agent能做事,就必须能审计
我们给Agent加了日志审计,每个操作都留痕。不是信不过模型,是怕出问题时连排查的入口都没。
四、单层防护不够
权限限制、环境隔离、监控告警,至少两层以上。之前只靠提示词约束,出了事才知道那层纸根本靠不住。
五、模型只是系统一部分
工具、凭证、环境、监控,每条链路都可能出问题。模型行为重要,但周边系统设计更重要。
别被"AI失控"这类标题带节奏,技术问题本质还是工程问题。权限最小化、失败假设、多层防护,这些老工程原则在AI时代反而更值钱。
全部回复 (5)
咖
咖啡续命折腾党
中级
13小时前
一小时才被发现确实有点久,但PyPI现在有项目级API token和2FA,不过恶意包走的是仿冒域名那套,验证再严也拦不住社工。关键是downloader们能不能搞个自动check新包流行度的机制?
0
完
安全这块儿确实是代理大规模落地后的隐形命门,很多团队连基本权限隔离都没做好。我自己倒觉得不用全转安全,先懂OWASP那套agent威胁模型,再深入至少一个框架的安全机制,就比大多数人强了。
0
调
阿
产
