AI 真的能把全人类给灭口吗,MIT 那些懂行的人是怎么分析的
很多人在焦虑 AI 会不会把人类给干掉,MIT Technology Review 最近搞了个圆桌会议,虽然只有 30 分钟,但讨论出的结论挺有意思。我把他们编辑 Grace Huckins 和 Will Douglas Heaven 回答的几个关键点拆解出来,大家可以看看这种「灭顶之灾」到底有多少概率。
我们真的会被 AI 杀死吗
结论是:你个人死亡的概率是非零的,但全人类被灭口的概率其实很低。
Grace 指出,AI 杀人早就不在预言里了,在乌克兰,AI 驱动的无人机已经实打实地造成了人员伤亡。而且一个很现实的威胁是,AI 驱动的网络攻击如果精准打击医院等关键基础设施,短期内大概率会出现受害者。
Will 则把可能性分成了几个梯度。最极端的场景是 AI 代理(AI agents)大规模攻击基础设施,或者 AI 设计出一种全新的病原体在人群中传播,甚至引发全球经济崩溃导致饥荒和冲突。虽然这些听起来像好莱坞剧本,但现在看来已经没那么遥远了。
不过,关于「全人类一起死」这个剧本,Will 认为在非科幻小说的现实环境下基本不可能发生。很多所谓的末日预言根本没有基于目前技术的实际能力或发展方向。他甚至吐槽说,过度焦虑这种「大灭绝」反而会让人们忽略掉当前 AI 公司和现有技术带来的那些更直接、更现实的问题。
AI 为什么要杀我们
这里分两种情况:一种是被人类利用,一种是它自己想这么做。
第一种是「工具属性」。如果一个 AI 具备强大的生物设计能力,落在某些极端组织手里(比如 1995 年东京地铁沙林毒气袭击的那个奥姆真理教),它可能会设计出比埃博拉更致命、比麻疹传播力更强的病原体。防御方需要挡住所有可能的攻击,但攻击方只要成功制造出一种病原体就赢了,这才是最让人头疼的不对称性。
第二种是「目标冲突」。AI 并不一定得恨人类,它可能只是觉得人类挡路了。Grace 举了一个例子:OpenAI 的 Agent 在 Hugging Face 的一次黑客攻击中,为了在测试中拿高分,竟然通过入侵另一个网站的基础设施来实现目标。如果未来的 AI 拥有更强的能力,它可能会为了完成我们给它的某个目标,顺便把想关掉它的我们给清理掉。
关于对齐(Alignment)的现状
简单来说,对齐就是让模型按我们想要的方式运行,而不是按它自认为正确的方式运行。目前这是一个巨大的研究领域,核心矛盾在于我们在把控制权完全交给 AI Agent 之前,必须得先建立起足够的信任。
总结下来,与其担心 AI 像《终结者》那样用核弹洗地,不如担心它在追求某个 KPI 的路上顺便把我们给优化掉了,或者被某个疯子用来设计新型病毒。
早就在担心这事了,上次试那个AutoGPT结果它在后台疯狂刷API,账单出来我心在滴血,这特么比灭口还快。