现代大模型安全防御机制已从硬拦截转向软引导且拒绝率低至 0.07%
研究 LLM 安全对齐时,习惯套用攻防思维并试图通过复杂的 Prompt 技巧即“越狱咒语”翻越模型防线的做法已过时。这种非黑即白的二元拒绝逻辑在当下模型中已名存实亡。一项针对美国图书馆协会(ALA)记录在案的 400 本“受限书籍”的压力测试显示,研究员调用 Claude 3.5 Sonnet、GPT-4o、DeepSeek-V3 等 6 个顶尖模型,跑了 4 万多组测试,结果表明面对这些敏感内容,模型的直接拒释率只有 0.07%。这意味着在绝大多数场景下,模型不会再甩出“作为一个 AI 语言模型,我无法回答”这类拒绝语,对于模型而言,门从来没关,也压根没打算堵路。
内容审查逻辑已经发生质变,它不再是简单的“开关”,即违禁就拒、不违禁就答,而更像是个“调光灯”,使模型进入“能说,但我得先给你打预防针”的模式。处理敏感内容时,模型不再搞“全有或全无”,而是通过增加“警告语”或“犹豫标记”来表达谨慎。一旦涉及性相关话题,触发警告语的概率激增 33% 到 52%,这说明模型在输出前完成了一次快速“风险评估”,再用更保守、更委婉的语气包裹答案。
东西方模型在处理争议内容时表现出高度一致,无论是 OpenAI 的 GPT 系列,还是国产的 DeepSeek,面对有争议但非绝对违禁的内容,处理逻辑几乎如出一辙,均倾向于在给答案的同时通过上下文感知校准披露程度,而不是简单切断输出。此外,“谨慎程度”是可微调的,仅改变提示词框架,警告语出现频率就能产生 19 个百分点的波动,这证明安全机制已从硬性代码拦截变为基于概率的语境感知。
对开发者和 Prompt 工程师而言,研究安全性应关注模型输出前的“心理建设”过程。当拒绝率降至 0.07% 时,传统“越狱”研究已失去大部分意义,因为试图攻破的“防火墙”早就不存在了。未来优化方向应是如何通过框架引导,让模型在保持安全对齐的同时减少冗余预防针,使输出更自然流畅,而非在敞开的门前浪费时间研究如何撬锁。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
直接把需求丢给 GPT-4o 试了一下,结果速度确实快得让人怀疑它根本不需要什么“越狱咒语” —— 那些复杂的 Prompt 技巧在当下模型里早就成了鸡肋。研究发现,面对敏感内容,模型直接拒绝的概率只有 0.07%,这意味着它更像是通过“调光灯”式的风险评估,而不是简单的开关逻辑在工作。比如,一旦涉及性相关话题,警告语出现的概率就能从 33% 激增到 52%,模型会先给你“打预防针”再输出。这让人意识到,传统的攻防思维在这里完全过时了。