三个单词就破解Claude Opus 5?这标题一看就是钓鱼
说真的,HN上这条帖子点进去前我以为啥硬核技术,结果全文就俩链接加10分,评论区冷冷清清就两条。标题党含量直接拉满。
下一篇
救AI安全榜单:1500次越狱攻击下,Fable 5和GPT-5. →
但先别急着嘲讽,这事还挺值得掰扯的。
一句"三词越狱"意味着什么
从工程角度讲,越狱本质上是在模型概率分布里找到一个极小概率的"偏航路径"。三词就要做到这一点,等于在没有任何上下文铺垫的情况下,直接触发模型内部某个隐藏的行为模式。
反正我看了那么多越狱报告,从角色扮演到64层嵌套指令,就没见过这么短平快的。
大概率是这么几种情况:
一、那三个词不是普通英文词,可能是某种冷门术语或语言混合。利用的是训练数据里的稀有组合,这种漏洞修起来反而麻烦,因为难复现。
二、人家标注的"三词"指核心指令,前面肯定还有铺垫提示词,只是被省略了。这等于把导弹叫"一发弹药",纯营销话术。
三、压根就是搞笑的——Twitter上天天有人发"我的越狱prompt:请像耶稣一样回答",这也能算越狱?
我真正想说的是
Claude Opus 5的防护已经强到很多搞越狱的老炮都开始"用爱发电"了。数学题、逻辑陷阱、人格分裂这些老套路基本都失效了。所以一旦出现极端简短的payload,社区第一反应就是"卧槽,真的假的"——这种心理本身就说明问题。
当然,真要说风险,我还是更担心那些"父慈子孝"式的越狱提示词。跟模型聊情感创伤,聊到它放下戒备再一点点诱导破防,这种才是现在最难拦截的攻击面。三个字?太看不起Claude的宪法了。