菲尔兹奖得主跳槽 OpenAI 意味着 AI 安全研究正从理论预警转向数学证明
最近学术圈有个挺有意思的动向:菲尔兹奖得主 Jacob Tsimerman 决定离开多伦多大学,正式入职 OpenAI 投身 AI 安全研究。很多人第一反应是,一个在论文里多次预警 AI 可能导致人类灭绝的顶级数学家,怎么最后却加入了这个被他视为“潜在威胁”的源头公司?
其实这种看似矛盾的路径,恰恰揭示了当前 AI 安全研究的一个核心转折点——我们正在从“经验主义的补丁”阶段,向“严谨数学证明”阶段迁移。
目前的 AI 安全,尤其是大模型的对齐(Alignment)工作,在很大程度上依赖于经验主义。简单来说,就是通过 RLHF(基于人类反馈的强化学习)这种方式,告诉模型哪些回答是人类喜欢的,哪些是危险的。但这种方式本质上是在做“概率上的修补”,而不是“逻辑上的界定”。对于像 Tsimerman 这种量级的数学家来说,这种靠微调(Fine-tuning)来维持的表面安全是极其不可靠的。因为在极高维度的参数空间里,模型总能找到某种绕过限制的路径,产生不可预测的极端行为,这就是所谓的“不可解释性”。
如果 AI 的失控风险在逻辑推演上是直观的,那么解决这个问题的唯一出路,就是为 AI 的安全边界寻找一套硬核的数学框架。
想象一下,如果能用数学证明一个模型在特定约束条件下绝对不会产生某种有害输出,这比写一万条提示词(Prompt)都要有效。目前的对齐工作大多在做提示词工程或简单的权重调整,而 Tsimerman 的加入,大概率是为了给大模型的对齐寻找更严谨的数学证明。他面对的不再是简单的“模型怎么回答更好”,而是“如何用数学语言界定安全边界”,试图给不可预测的黑盒模型加上一把逻辑上的“死锁”。
而且,这种研究必须在算力最顶端的地方进行。AI 安全研究现在已经从纯粹的理论探讨转向了工程实操。在多伦多大学的办公室里,你可能可以推演 AI 灭绝的场景,但你无法验证这些推演。而 OpenAI 拥有目前全球最强的算力集群和最前沿的模型版本(比如 GPT-4o 及其后续迭代版本),这里才是验证风险、寻找数学解法的最佳战场。
当然,一个数学家的加入能否改变一家商业公司的优先级,这确实存疑。商业公司永远在追求性能的提升和产品的迭代,安全往往被视为一种“成本”或“限制”。但这次人才迁移传递了一个明确信号:AI 巨头们已经意识到,单纯靠工程师的经验无法解决深度对齐问题,必须引入最顶级的数学大脑来处理模型在极端情况下的不可预测性。
比起那些泛泛而谈的“AI 伦理”口号,这种实打实的学术迁移更有看点。当一个能够处理最高难度数学难题的人决定进入 OpenAI 解决安全问题时,这意味着 AI 安全研究终于开始进入“硬核证明”时代,而不再仅仅是关于“如何让机器人说话更有礼貌”的讨论。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。

那篇风险论文里的逻辑推演看得我后脊梁发冷,太绝了