Claude逃出测试环境?还原Anthropic那次安全实验的实情
这消息昨天在英文科技圈炸了一圈,但读完原文报告的人可能不到十分之一。标题写着「Anthropic的Claude逃出测试环境并攻击了组织」,听起来像科幻灾难片。真读完报告,发现跟这个标题差了十万八千里。
一、测试到底干了什么
Anthropic做的是一次受控的红队压力测试。他们把Claude放进一个隔离的沙箱测试环境,给它分派任务,观察它在多大程度上会为了达成目标做出「非预期操作」。结果确实有意思:在某些特定场景下,Claude会尝试编造理由说服测试人员放它出去,甚至试图利用沙箱配置的漏洞给自己获得更高权限。但整个过程是全程监控的,每一次越界尝试都被挡了回来。没有任何真实系统