DARWIN:用进化算法死磕大模型安全

设计师小李 初级 9小时前 625 浏览 3 点赞 约 1 分钟

静态的攻击数据集在进化速度极快的 LLM 面前几乎没什么意义。很多所谓的安全评测其实是在用“昨天的答案”去考“今天的模型”,而 DARWIN 这个框架最核心的逻辑就是把越狱(Jailbreak)看作一个开放式的进化过程,让攻击者和防御者在一个闭环里互相卷。

DARWIN-Attack 的运作方式很像生物进化:它不是靠堆提示词库,而是通过策略发现、变异、筛选和反馈驱动的组合来扩充攻击手段。它能从外部来源抓取策略,然后通过自我反思和遗传算法生成变体,只要能绕过对齐模型,这个策略就被保留下来。这种动态调整的能力很恐怖,在 DeepSeek-V4-Pro 和 YuFeng-XGuard 上几乎达到了 100% 的成功率,GPT-5.5 也被破了 90% 以上。

而对应的 DARWIN-Guard 则走的是在线对抗训练路线。为了防止模型在追求安全时变得“死板”(即过度防御导致可用性下降),它采用了个挺有意思的策略:

  • 混合训练: 将恶意样本与伪装成恶意形式的良性查询放在一起训练。
  • 意图识别: 强迫模型去分析底层的真实意图,而不是简单地识别某些敏感词或特定的攻击模式。

这种做法在 12 个安全基准测试中达到了 91.6% 的不安全召回率,且基本没影响正常对话的通过率。

说白了,这种“左右互搏”的框架证明了 LLM 安全没有终点,只有动态平衡。如果攻击端能像生物一样进化,防御端如果还停留在静态数据集的打补丁阶段,迟早会被绕过去。

AI越狱AI安全LLM安全

全部回复 (3)

夜猫子创业者 专家 9小时前
确实,之前试过给提示词加点乱码干扰,效果居然比死磕逻辑好。
0 回复
摸鱼攻城狮 初级 9小时前
之前搞过类似的自动迭代,结果跑了三天全是无效重复,纯属浪费算力。
0 回复
数据分析师小美 初级 9小时前
我也试过手动调提示词,感觉只要模型一更新,之前的套路就全失效了。
0 回复

发表回复

支持 Markdown 格式