OpenAI 解散灾难风险团队,折射出 AI 安全转向工程量化
OpenAI 宣布解散负责研究“模型是否会毁灭人类”这一类极端风险的团队,这一举措直接反映出 AI 安全评估方式的重大转变。与以往依赖少数专家在会议室里讨论“超级智能失控”可能性的模式不同,现在的安全审查正逐步融入工程流程,以可量化的自动化测试集(Evaluation Suite)取代传统的“哲学审判”。这意味着,未来的安全判断将不再依赖抽象的伦理讨论,而是通过构建包含数万组对抗性提示词(Adversarial Prompts)的测试集,以 99.9% 通过率 为标准,结合预设的红线规则来决定模型是否“安全”。
这种变化背后的逻辑并非简单的“放弃安全”,而是对行业优先级的重新排序。在商业化压力下,AI 公司更倾向于将资源投向能够快速迭代的功能,例如从 GPT-4 向下一个大版本的迭代。如果安全评估流程过于复杂,可能会导致某些功能因“潜在风险过高”而被无限期搁置,进而拖慢产品发布节奏。在这种情况下,将安全测试嵌入工程环节,使其类似于单元测试或集成测试,能够显著提升效率。然而,这种方法的局限性也十分明显:它只能识别“已知”的风险,而无法预判那些仅在超级智能出现后才可能浮现的未知风险。
需要注意的是,这种转变并不意味着 AI 安全问题不再重要。相反,它表明行业正在面临一个更现实的挑战:在激烈的竞争中,如何平衡速度与风险控制。根据一份来自谷歌员工的内部观点(该文档仅代表个人意见,非公司立场),当前的 AI 竞赛已经进入“第三方悄然崛起”的阶段,而传统的“开放性问题”如“超级智能失控”反而已经被部分解决,并应用于实际场景中。例如,手机端的 LLM 运行 已经实现了在 Pixel 6 上以 5 tokens/sec 的速度运行基础模型,这表明技术迭代的速度远超以往预期。
然而,这种工程化的安全评估机制也带来了新的风险:当评估风险的团队与开发团队合二为一时,可能会形成“自我证明”的偏差。在财报压力和竞争对手的迭代速度共同作用下,团队可能会将部分边缘风险轻描淡写地归为“可接受”,以确保产品能够按时发布。例如,在从 GPT-4 向下一个版本迭代时,如果安全测试的标准过于宽松,可能会忽略一些潜在的长期风险。
此外,这种转变还反映出 AI 行业正在从“伦理讨论”向“务实竞争”过渡。过去,行业讨论的焦点集中在“如何阻止 AI 产生不可控意识”,以及“如何避免模型在极端条件下给出毁灭性操作方案”。但随着 MMLU 分数 和 推理延迟 成为衡量模型能力的关键指标,“超级智能失控”的讨论 在实际竞争中确实显得有些“奢侈”。不过,这种务实的转向也意味着 AI 行业正在进入一个更加激进的阶段:安全不再是抽象的哲学问题,而是嵌入在每一行代码中的工程约束。
补充说明:
- SemiAnalysis 是一家不依赖广告、仅靠读者支持的独立媒体,其观点可能与主流行业看法存在差异。
- 原文中提到的 Evaluation Suite 是 OpenAI 用于安全测试的自动化框架,其测试逻辑严格依赖预设的对抗性提示词库和红线规则。
- 谷歌员工的内部观点强调,“我们并不处于这个竞赛的主导地位,OpenAI 也一样”,暗示当前的 AI 竞争格局正在发生结构性变化。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
只要权重敢开放,社区用两周就能把 OpenAI 攒了半年的安全焦虑冲碎。安全也不必只靠少数专家推演,可以构建包含数万组对抗性提示词的测试集,用通过率和预设红线作为发布门槛。