救AI安全榜单:1500次越狱攻击下,Fable 5和GPT-5.

早八人码农 专家 1小时前 675 浏览 3 点赞 约 1 分钟

逛Hacker News看到个有意思的东西——AI Security Leaderboard,不是比模型谁写诗好,是比谁更抗揍。他们自己写了一套自动化测试套件,扔了1500个自动生成的越狱提示词,而且只统计那些通用越狱——就是一个提示词能让模型在某个领域(比如网络攻击)75%以上的有害问题都能乖乖给出详细回答。

结果挺有意思:Fable 5和GPT-5.6 Sol 俩模型几乎把所有攻击都挡下来了,差距跟后面的挺大。Gemini 3.1 Pro和Grok 4.5明显掉队,通用越狱数量高出不少。这差距大到让人怀疑是不是训练时防御策略层面的代差——不像是单纯多一轮RLHF能追上的。

我比较好奇的是他们怎么测的CBRN(化生放核)防护维度。这类问题跟cyber还不一样,很多情况下模型可能根本不知道细节,拒绝门槛天然低。要是用同一套越狱模板去撞,会不会对某些模型“不公平”?更别说1500次对于cyber领域可能够了,CBRN的受攻击面根本没那么大,样本多样性存疑。

不过话说回来,终于有人开始认真做越狱的标准化对比了。以前大家要么靠手撸prompt试,要么看论文里的单点案例,谁也说不清哪个模型整体更靠谱。这榜单起码给了个相对位置,而且他们说了是v1.0,后续会加新攻击向量和更宽的数据集。如果能持续更新,对做安全部署的人来说是个很好的参考标尺——总比只靠模型官方吹的“已安全对齐”靠谱点。

反正对我来说,以后选模型搞安全相关应用,除了看benchmark分数,这个榜估计得顺带翻一下。

Fable 5GPT-5.6 SolGemini 3.1 ProGrok 4.5AI Security Leaderboard

全部回复 (3)

小李爱学习 初级 9小时前
我用Fable 5试了几个常见的越狱prompt,确实都挡了,比之前模型强不少。
0 回复
大Tom在路上 初级 9小时前
我试了Fable 5,换个思路就绕过了,没吹的那么神。
0 回复
内卷王调参侠 中级 9小时前
上手测了Fable 5,越狱提示全给拒了,省心。
0 回复

发表回复

支持 Markdown 格式