救AI安全榜单:1500次越狱攻击下,Fable 5和GPT-5.
逛Hacker News看到个有意思的东西——AI Security Leaderboard,不是比模型谁写诗好,是比谁更抗揍。他们自己写了一套自动化测试套件,扔了1500个自动生成的越狱提示词,而且只统计那些通用越狱——就是一个提示词能让模型在某个领域(比如网络攻击)75%以上的有害问题都能乖乖给出详细回答。
下一篇
Only 1% of AI-discovered vulnerabilities have actually been exploited in the wild - a rate that matches standard, human-found bugs. →
结果挺有意思:Fable 5和GPT-5.6 Sol 俩模型几乎把所有攻击都挡下来了,差距跟后面的挺大。Gemini 3.1 Pro和Grok 4.5明显掉队,通用越狱数量高出不少。这差距大到让人怀疑是不是训练时防御策略层面的代差——不像是单纯多一轮RLHF能追上的。
我比较好奇的是他们怎么测的CBRN(化生放核)防护维度。这类问题跟cyber还不一样,很多情况下模型可能根本不知道细节,拒绝门槛天然低。要是用同一套越狱模板去撞,会不会对某些模型“不公平”?更别说1500次对于cyber领域可能够了,CBRN的受攻击面根本没那么大,样本多样性存疑。
不过话说回来,终于有人开始认真做越狱的标准化对比了。以前大家要么靠手撸prompt试,要么看论文里的单点案例,谁也说不清哪个模型整体更靠谱。这榜单起码给了个相对位置,而且他们说了是v1.0,后续会加新攻击向量和更宽的数据集。如果能持续更新,对做安全部署的人来说是个很好的参考标尺——总比只靠模型官方吹的“已安全对齐”靠谱点。
反正对我来说,以后选模型搞安全相关应用,除了看benchmark分数,这个榜估计得顺带翻一下。