Anthropic拿了C+:最讲安全的大模型公司,翻车了?

前端大鹏 初级 3小时前 40 浏览 12 点赞 约 2 分钟

说实话,看到这个评分的时候我愣了一下。未来生命研究所的2026 AI Safety Index,给各大实验室在风险管理、透明度、还有他们是否言行一致这几个维度上打分。Anthropic,那个把「安全」刻在脑门上当slogan的实验室,得了个C+。

Anthropic拿了C+:最讲安全的大模型公司,翻车了?

这就有意思了。先说清楚,这个C+不是野榜瞎评,FLI是正经机构,评的是三块:风险管理做没做到位、透明度高不高、以及承诺和实际行为对不对得上。Anthropic在「承诺」这块一向拉满——什么 Responsible Scaling Policy,什么AI Safety Level,对外讲得头头是道。但评出来只有C+,说明分数看的不只是PPT。

我猜问题大概率出在两方面。一是透明度,Anthropic对模型内部机制和训练细节的披露一直很保守,安全研究发paper是一回事,但具体部署时的监控数据、红队结果、失败案例,都是点到为止。二是他们嘴上说安全优先级最高,但产品迭代速度一点没慢下来,新模型该上就上,这中间的gap,评估机构看得清清楚楚。

对比一下,这个维度上做得好的反而是那些更「笨拙」的实验室,评测方法老派但数据全开放,Red Team结果直接甩出来,连「我们没拦住」的案例都敢放。这才叫透明度。而Anthropic的安全姿态太有型了,反而像公关行为艺术——安全人设立得越高,评分机构挑刺的空间就越大。

顺带说一句,这跟AI越狱话题其实是一个硬币的两面。越狱测试本质上就是在替这些实验室做压力测试:你声称自己的模型多安全,我拿一千条攻击提示词试试你的边界到底在哪。C+这个分数,某种程度上也解释了为什么社区总能找到各种破甲手法——安全机制再先进,跟实际攻击面之间永远隔着一条产品化的鸿沟。

安全这东西,吹出来的从来不算数,得拿数据、拿失败记录、拿真实的红队报告来换分数。C+不冤,但希望他们别急着公关,先把内部测试的log公开了再说。

anthropic未来生命研究所AI安全指数红队越狱测试

全部回复 (3)

阿小美 中级 3小时前
他们那个可解释性研究后来到底落地了没?
0 回复
深漂独立开发者 中级 2小时前
我用Claude写东西,一提到政治就秒拒,安全过头反而耽误事。
0 回复
全栈小李 高级 2小时前
其实他们的红队测试结果从来不敢公开细节,这透明度打啥分。
0 回复

发表回复

支持 Markdown 格式