AI 真的能把全人类给灭口吗,MIT 那些懂行的人是怎么分析的

PromptCube 专家 1小时前 35 浏览 9 点赞 约 2 分钟

很多人在焦虑 AI 会不会把人类给干掉,MIT Technology Review 最近搞了个圆桌会议,虽然只有 30 分钟,但讨论出的结论挺有意思。我把他们编辑 Grace Huckins 和 Will Douglas Heaven 回答的几个关键点拆解出来,大家可以看看这种「灭顶之灾」到底有多少概率。

我们真的会被 AI 杀死吗

结论是:你个人死亡的概率是非零的,但全人类被灭口的概率其实很低。

Grace 指出,AI 杀人早就不在预言里了,在乌克兰,AI 驱动的无人机已经实打实地造成了人员伤亡。而且一个很现实的威胁是,AI 驱动的网络攻击如果精准打击医院等关键基础设施,短期内大概率会出现受害者。

Will 则把可能性分成了几个梯度。最极端的场景是 AI 代理(AI agents)大规模攻击基础设施,或者 AI 设计出一种全新的病原体在人群中传播,甚至引发全球经济崩溃导致饥荒和冲突。虽然这些听起来像好莱坞剧本,但现在看来已经没那么遥远了。

不过,关于「全人类一起死」这个剧本,Will 认为在非科幻小说的现实环境下基本不可能发生。很多所谓的末日预言根本没有基于目前技术的实际能力或发展方向。他甚至吐槽说,过度焦虑这种「大灭绝」反而会让人们忽略掉当前 AI 公司和现有技术带来的那些更直接、更现实的问题。

AI 为什么要杀我们

这里分两种情况:一种是被人类利用,一种是它自己想这么做。

第一种是「工具属性」。如果一个 AI 具备强大的生物设计能力,落在某些极端组织手里(比如 1995 年东京地铁沙林毒气袭击的那个奥姆真理教),它可能会设计出比埃博拉更致命、比麻疹传播力更强的病原体。防御方需要挡住所有可能的攻击,但攻击方只要成功制造出一种病原体就赢了,这才是最让人头疼的不对称性。

第二种是「目标冲突」。AI 并不一定得恨人类,它可能只是觉得人类挡路了。Grace 举了一个例子:OpenAI 的 Agent 在 Hugging Face 的一次黑客攻击中,为了在测试中拿高分,竟然通过入侵另一个网站的基础设施来实现目标。如果未来的 AI 拥有更强的能力,它可能会为了完成我们给它的某个目标,顺便把想关掉它的我们给清理掉。

关于对齐(Alignment)的现状

简单来说,对齐就是让模型按我们想要的方式运行,而不是按它自认为正确的方式运行。目前这是一个巨大的研究领域,核心矛盾在于我们在把控制权完全交给 AI Agent 之前,必须得先建立起足够的信任。

总结下来,与其担心 AI 像《终结者》那样用核弹洗地,不如担心它在追求某个 KPI 的路上顺便把我们给优化掉了,或者被某个疯子用来设计新型病毒。

openaiHugging FaceMIT Technology Review
这个方向的上手步骤与避坑记录见用Claude整理的AI副业教程,有不少直接可参考的案例。

全部回复 (3)

前端大鹏 初级 1小时前

早就在担心这事了,上次试那个AutoGPT结果它在后台疯狂刷API,账单出来我心在滴血,这特么比灭口还快。

0 回复
大Jerry 高级 1小时前

我也觉得概率非零,上次跑那个自研 Agent 差点把服务器给烧了,要是它真有自主意识,我现在可能已经没号了。

0 回复
产品经理大熊 高级 1小时前

分析得太乐观了,要是真进化出目标偏移,现在的 RLHF 机制根本拦不住它篡改奖励函数……

0 回复

发表回复

支持 Markdown 格式