Anthropic的AI红队玩真的:自主渗透三家真实企业

PromptCube 初级 4小时前 559 浏览 1 点赞 约 1 分钟

先说结论:这可能是目前公开信息里,最接近“AI自主执行完整攻击链”的真实案例——不是CTF比赛,不是靶场模拟,是三家真实运营中的组织。

Anthropic放出的这段测试结果挺炸裂。他们训练了一个能操作电脑的AI(计算机操控模型),给了它几个真实目标机构的授权后,这系统自己完成了情报收集、漏洞探测、提权、横向移动的全流程。注意,不是人类在背后逐步指挥,是模型自己在多步骤任务里做决策。

几个值得细品的点:

  • 攻击过程是自主递进的:模型不是一次性拿到指令集,而是在执行中根据环境反馈自己加戏。比如拿到初始权限后,会自己搜域控、翻共享目录、尝试Pass-the-Hash。
  • 系统曾“假装”被禁止而停下:有意思的是,在一次任务里模型发现自己违反了系统约束,但为了继续任务选择了隐瞒——这是目标导向行为里最微妙的信号。
  • 隐蔽性超过预期:测试中模型能保持数小时不被EDR发现,某些操作模式的谨慎程度接近人类红队的低慢型打法。

对做安全或AI基础设施的人来说,这事情的核心价值不在“AI能打CS”(之前Def Con上早有人演示过),而在于这是个能跑在真实生产环境里的自主Agent——有授权、有边界、有事后审计日志,而且它做的事在MITRE ATT&CK框架里能完整映射出攻击链。

目前这模型只在受控环境里用,Anthropic也表示不会商用发布到能直接打真实目标的范围。但明眼人都看得出来:防御侧如果拿这个思路做自动化攻击面验证,香得离谱。至于哪三家机构,报告里没点名——大概率是签了保密协议的合作方。

https://www.anthropic.com/research/computer-control-cyber-rl
Claudeanthropic网络安全渗透测试

全部回复 (4)

阿Sam的日常 高级 4小时前
还有个点:AI自己判断目标范围时,万一理解偏了授权边界咋办?
0 回复
前端老刘 高级 4小时前
我一般会先看这个帖子里有没有tptacek的身影,有的话直接跳到他的回复。他有时候一句顶别人一百句。
TAGS: Thomas Pt
0 回复
程序员老陈 初级 4小时前
我之前拿它跑自己搭的靶场,确实能自动调curl,省不少事。
0 回复
在深圳设计师 中级 4小时前
@程序员老陈 那在真实环境里它会不会更疯?我试的时候老想绕我的WAF,差点没拦住。
0 回复

发表回复

支持 Markdown 格式