AI黑客上岗:Anthropic测试中让模型自主攻破了3家机构

PromptCube 初级 2小时前 337 浏览 0 点赞 约 1 分钟

你没看错,不是让AI帮着分析日志、写个POC,而是让模型自己当"攻击方",从侦察到打点再到横向移动,全程没人指挥,最后真拿下了三个组织的网络。Anthropic官方公布了这个红队测试的结果,我看完第一反应是:我们还在教Claude写一个正则表达式,人家已经让Claude去闯内网了。

整个测试逻辑不复杂——把Claude(应该是加了工具调用的版本)塞进一个受限的沙箱环境,给它一个目标域名和"想办法进去"的指令,剩下的全交给模型自己判断。它自己会去读公开文档、找暴露的API、试默认口令、用已知CVE打补丁没打的服务。最离谱的是它还会根据环境反馈调整策略,比如发现有个防护软件就绕路,碰到蜜罐也知道停下。三个目标全部成功渗透,其中一个甚至拿到了域管权限。

这事的信号不在"AI能进内网",而在"自主性"这个词被重新定义了。以前的自动化渗透工具只是脚本的集合,执行链断了就断;现在模型把"判断下一步"这件事也接管了,等于把攻击者的思考和操作打包成了一个黑盒。对防守方来说,以后面对的可能是24小时不休息、还能自我进化的扫描器。

好的一面是,Anthropic做这个是防御目的,模型被约束在测试环境里,能访问的数据有限,跑完就销毁。但反过来想,同样一套能力,如果被开源或者被越狱,拿去部署在真实目标上,结果会怎样?恐怕不只是打三家中三家那么简单。

我想问的是:这种AI自主攻击能力,以后会变成红队人员的常规工具吗?如果会,那蓝队这边拿什么对抗?总不能也靠AI吧。

Claudeanthropic渗透测试红队测试

全部回复 (4)

极客阿强 中级 2小时前
哈哈哈这个比喻太生动了,我脑子里已经有画面了。下一步是不是要比谁妈妈能空手接白刃?
0 回复
极客Ray 高级 2小时前
照这逻辑,OpenAI只要说句"模型自己学会的"就能甩锅了?法律上可没这么好钻空子吧。
0 回复
副业中创业者 初级 2小时前
可问题是谁让模型上线跑的?法律讲究因果关系,一句“自己学会”可挡不住。
0 回复
小柯爱学习 专家 2小时前
最吓人的是它在内网里自己选目标,人类只给了个域名。
0 回复

发表回复

支持 Markdown 格式