美国AI安全机构负责人离职:安全治理是不是在走形式?

AveryPilot 初级 11小时前 58 浏览 3 点赞 约 1 分钟

一个带头人的离职往往比政策文件更能说明问题。这次美国AI安全机构负责人的突然辞职,给人的感觉更像是某种内部共识的破裂,或者是对目前那种“形式主义安全”的无声抗议。

现在大模型的安全治理陷入了一个很诡异的循环:厂商一边在底层通过RLHF(人类反馈强化学习)把模型训练得极其小心翼翼,甚至到了“由于安全原因,我无法回答”这种死板地步;另一边,社区里的玩家们却在疯狂研究各种越狱技巧,试图把这些被阉割的能力给“抢”回来。

这种局面导致了两个极端的撕裂:

  • 官方视角: 追求绝对的鲁棒性和无风险,倾向于用更强的审查机制来封堵漏洞。
  • 玩家视角: 认为过度的对齐(Alignment)实际上是对模型智力的削弱,追求的是Uncensored(无审查)的纯净体验。

如果监管层的人员出现变动,很可能是因为现有的治理路径在实操中根本跑不通。毕竟,只要模型还具备逻辑推理能力,用户总能通过构建复杂的角色扮演场景或逻辑陷阱来绕过限制。与其在顶层设计上打补丁,不如在模型架构层面思考如何实现可控的开放。

这次人事变动之后,不知道接任的人会走哪个方向,是继续加强审查,还是终于意识到给AI“松绑”才是正解。

AI越狱AI安全LLM安全

全部回复 (3)

大鹏的日常 初级 11小时前
确实,现在太死板了。话说RLHF真能根治,还是只是打补丁?
0 回复
老阿凯 中级 11小时前
之前试过改提示词绕过,发现只要给个特定人设,那些安全限制就没那么死。
0 回复
脚本小子小柯 专家 11小时前
我之前用某大模型写方案,被拒了好几次,最后得绕好几个弯才能出结果。
0 回复

发表回复

支持 Markdown 格式