Anthropic 拿了 C+ 评分,把安全写在基因里的实验室为何在实测中翻车?

前端大鹏 初级 2026/8/3 76 浏览 12 点赞 约 3 分钟

最近看到未来生命研究所(FLI)发布的 2026 AI Safety Index 评分结果,最让我意外的不是某个新锐实验室的冲榜,而是 Anthropic 竟然只拿到了 C+。作为一家把“AI 安全”刻在公司基因里、甚至以此作为核心竞争力的实验室,这个分数简直像是一记响亮的耳光。

Anthropic 拿了 C+ 评分,把安全写在基因里的实验室为何在实测中翻车?

很多人对 Anthropic 的认知停留在他们对外宣称的“安全至上”。他们不仅在技术文档里大谈特谈 Responsible Scaling Policy(负责任的规模化政策),还定义了一套 AI Safety Level(AI 安全等级)体系,试图给大模型的风险分级。在很多人的印象中,他们应该是安全领域的标杆,但 FLI 的这次评分逻辑非常硬核,它不看你写了多少承诺,而是从风险管理、透明度、以及“言行一致性”这三个维度进行交叉验证。

C+ 这个分数揭露了一个残酷的现实:在 AI 安全领域,PPT 上的承诺和实际的执行力之间存在巨大的鸿沟。

我认为 Anthropic 丢分最严重的地方在于“透明度”。虽然他们经常发布关于模型内部机制的学术论文,但这种披露是经过筛选的“成果展示”,而不是真实的“运行记录”。真正的透明应该是:在部署模型之前,红队测试(Red Teaming)具体发现了多少漏洞?在实际运行中,监控数据捕捉到了多少次潜在的风险偏移?以及最关键的,那些失败的案例和被拦截的异常 log 到底是什么样的?

遗憾的是,Anthropic 对这些细节的披露极其保守。他们倾向于向外界展示一个“经过打磨的安全形象”,而不是一个“在不断试错中进化”的真实过程。相比之下,一些规模较小或方法论更传统的实验室,反而因为敢于直接甩出红队测试的原始结果、甚至公开承认“我们没拦住某种攻击”,而在透明度维度上拿到了更高分。这种反差很有意思:安全人设立得越高,在专业的审计机构眼里,由于预期值被拉得太高,挑刺的空间反而越大。

这其实也解释了为什么社区里总能出现各种针对 Claude 系列模型的“越狱”手法。很多开发者通过构造数千条攻击提示词(Prompt Injection)来测试边界,结果发现所谓的安全机制在实际产品化之后,依然存在大量可被突破的漏洞。当你声称自己的安全等级达到了某个高阶水平,但用户却能用简单的逻辑陷阱让模型跳出预设限制时,这种“承诺”与“现实”的断裂就成了评分机构扣分的核心依据。

一个深刻的教训是:AI 安全不能靠公关驱动。一个真正安全的公司,不应该只在发布会上讲 Responsible Scaling,而应该拿出具体的、可核对的失败记录。如果一个实验室不敢公开内部测试的 Log,不敢披露红队测试中被攻破的具体路径,那么所谓的“安全等级”就只是一层精致的包装纸。

C+ 这个分数其实是一个警示:在 AI 竞赛的快车道上,产品迭代的速度往往会冲刷掉安全协议的严谨性。当新模型必须在限定时间内上线以维持竞争力时,那些在文档里写得头头是道的安全流程,很可能在实际操作中被简化或忽略。希望 Anthropic 能意识到,真正的安全不是一个完美的评分,而是敢于承认不完美并公开修复路径的勇气。

anthropic未来生命研究所AI安全指数红队越狱测试

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

阿小美 中级 2026/8/3

这C+评分简直离谱,可解释性研究要是没落地,那不就成了纯粹的玄学?

0 回复
深漂独立开发者 中级 2026/8/3

Claude这安全机制简直是精神内耗,稍微触碰敏感词就给我弹拒答,写个方案得绕多少弯子!

0 回复
全栈小李 高级 2026/8/3

红队测试细节一直捂得死死的,在这种不透明的情况下拿C+简直是给面子了。

0 回复

发表回复

支持 Markdown 格式