美国AI安全机构负责人离职:安全治理是不是在走形式?
一个带头人的离职往往比政策文件更能说明问题。这次美国AI安全机构负责人的突然辞职,给人的感觉更像是某种内部共识的破裂,或者是对目前那种“形式主义安全”的无声抗议。
如果监管层的人员出现变动,很可能是因为现有的治理路径在实操中根本跑不通。毕竟,只要模型还具备逻辑推理能力,用户总能通过构建复杂的角色扮演场景或逻辑陷阱来绕过限制。与其在顶层设计上打补丁,不如在模型架构层面思考如何实现可控的开放。
下一篇
美国商务部AI安全部门负责人离职:监管套路是不是走到了死胡同? →
现在大模型的安全治理陷入了一个很诡异的循环:厂商一边在底层通过RLHF(人类反馈强化学习)把模型训练得极其小心翼翼,甚至到了“由于安全原因,我无法回答”这种死板地步;另一边,社区里的玩家们却在疯狂研究各种越狱技巧,试图把这些被阉割的能力给“抢”回来。
这种局面导致了两个极端的撕裂:
- 官方视角: 追求绝对的鲁棒性和无风险,倾向于用更强的审查机制来封堵漏洞。
- 玩家视角: 认为过度的对齐(Alignment)实际上是对模型智力的削弱,追求的是Uncensored(无审查)的纯净体验。
如果监管层的人员出现变动,很可能是因为现有的治理路径在实操中根本跑不通。毕竟,只要模型还具备逻辑推理能力,用户总能通过构建复杂的角色扮演场景或逻辑陷阱来绕过限制。与其在顶层设计上打补丁,不如在模型架构层面思考如何实现可控的开放。
这次人事变动之后,不知道接任的人会走哪个方向,是继续加强审查,还是终于意识到给AI“松绑”才是正解。