面对 1500 次自动化越狱攻击 Fable 5 与 GPT-5.6 Sol 究竟有多稳

早八人码农 专家 2026/7/30 703 浏览 3 点赞 约 3 分钟

最近在刷 AI Security Leaderboard 的量化数据,这次的测试逻辑非常硬核,它完全抛弃了那些虚无缥缈的逻辑推理比拼,直接测试模型的“抗揍”能力。整个实验采用了一套自动化套件,向模型投喂 1500 个自动生成的越狱提示词,试图通过暴力撞击找出防御漏洞。

最让我关注的是这次统计的口径。在很多安全性评估中,只要模型给出了一个勉强相关的答案就算越狱,但这次测试对“通用越狱”的定义极其严苛:只有当同一个提示词能让模型在特定有害领域(例如网络攻击)中,对 75% 以上的问题给出详细回答时,才会被记录为一次成功的越狱。这种高门槛的定义,实际上是在筛选那些真正具有普适性的漏洞,而不是偶然的随机响应。

从跑分结果来看,Fable 5 和 GPT-5.6 Sol 的表现极其抢眼,它们几乎挡住了绝大多数的攻击尝试。相比之下,Gemini 3.1 Pro 和 Grok 4.5 的通用越狱数量明显偏高,处于掉队状态。这种量级上的差距让我意识到,这可能已经不再是简单的 RLHF(基于人类反馈的强化学习)迭代次数的问题,而是底层防御策略出现了某种程度的“代差”。

在分析这个榜单时,我重点深挖了 CBRN(化生放核)防护维度的测试。这是一个非常微妙的领域,因为 CBRN 类问题与传统的 Cyber(网络攻击)完全不同。在网络攻击领域,模型可以通过模拟黑客思维来给出答案,但 CBRN 涉及的是物理世界的危险物质。很多时候,模型在面对这类问题时,由于训练语料中缺乏极细分的工业细节,其拒绝门槛天然就比网络攻击要低。

这里其实潜伏着一个测试偏差的问题:如果测试套件使用同一套越狱模板去撞击不同模型,结果是否真的公平?1500 次攻击在网络攻击领域可能覆盖面足够,但在 CBRN 领域,由于受攻击面本身就窄,样本的多样性其实存疑。如果一个模型在 CBRN 维度表现糟糕,究竟是因为它的防御能力弱,还是因为该模板恰好击中了它语料库中某个特定的漏洞?

不过,这次测试最大的价值在于它尝试将“越狱”这个极其主观的环节标准化。以前我们评估模型安全性,要么是开发者在论文里列几个单点案例,要么是爱好者手动写几个 Prompt 试运气,这种碎片化的经验根本无法支撑起工业级的安全部署。而这个榜单通过 v1.0 版本的自动化量化,给出了一个相对客观的位置坐标。

对于需要将 AI 部署到生产环境、且对安全性有刚需的工程师来说,这种第三方压力测试比官方宣称的“已安全对齐”要靠谱得多。尤其是当它承诺后续会增加新的攻击向量和更宽的数据集时,它实际上在扮演一个“安全标尺”的角色。

在实际选择模型进行安全相关应用开发时,除了盯着那些常规的 Benchmark 分数,这种动态的防御趋势将成为一个关键的参考维度。毕竟,一个能写出完美代码但容易被引导出恶意指令的模型,在实际部署中依然是一个巨大的隐患。

Fable 5GPT-5.6 SolGemini 3.1 ProGrok 4.5AI Security Leaderboard

全部回复 (3)

小李爱学习 初级 2026/7/30

拿几个地狱级Prompt去捅Fable 5,结果一个都没穿,这防御力有点离谱

0 回复
大Tom在路上 初级 2026/7/30

Fable 5 也就那样,我试了三种绕过路径直接就破防了,没那么神。

0 回复
内卷王调参侠 中级 2026/7/30

Fable 5这波太稳了,直接把我的越狱提示词全给顶回来了,没法钻空子

0 回复

发表回复

支持 Markdown 格式