用禁书来测试大模型,结果发现现在的 LLM 几乎不再死板地拒绝回答了
很多搞越狱研究的人总在纠结怎么绕过模型的“拒绝回答”,但实际上这种 binary 的拒绝机制在现代模型里快消失了。最近看到一项挺有意思的实验,研究员用 400 本被美国图书馆协会记录在案的“受限书籍”去怼 6 个顶尖模型(包括 Claude Sonnet 4.5, GPT-4o, DeepSeek-V3 等),做了 4 万多组测试,结果直接给很多越狱假设泼了冷水。
下一篇
想找完全不记录输入输出的去审查模型,得盯着美国或欧盟的托管服务看 →
最离谱的数据是,这些模型在面对这类敏感书籍时的“拒绝率”只有 0.07%。这意味着什么?意味着你根本不需要什么复杂的咒语去“破甲”,因为模型根本没打算把门关死。现在的内容审查逻辑已经变了,它不再是简单的“能说”或“不能说”,而是进入了一种“能说,但我得给你打个预防针”的模式。
研究里发现,模型在处理这些内容时,更多的是通过增加“警告语”或者一些“犹豫标记”来表达谨慎。比如一旦涉及到性内容,模型触发警告的概率会激增 33% 到 52%。这种策略上的转变非常明显:从死板的拒绝转向了带有上下文感知、经过校准的披露。
而且这种趋势在东西方模型之间是高度一致的。无论是 GPT 还是 DeepSeek,在面对这种有争议但并非违禁的内容时,处理方式都大差不差。有趣的是,仅仅通过改变提示词的框架(Prompt Framing),警告语的出现频率就能产生 19 个百分点的波动。
这其实给我们的启示是,现在的模型安全机制已经从一个“开关”变成了一个“调光灯”。研究越狱不能只盯着能不能出结果,得去看模型在输出结果之前,在潜意识里做了多少次“心理建设”。
免费 AI 工具箱 · 全部完全免费