AI 递归自我进化能不能直接导致智能爆炸,我觉得 Vinyals 的判断更客观
很多人在讨论 AI 只要能自我迭代写代码,很快就能通过递归提升智力,直接冲向超级智能。但前 DeepMind 研究负责人 Oriol Vinyals 的观点泼了冷水,他认为这种“智能爆炸”概率不高。即便 AI 能把研究速度提升 10 倍,它依然会被两个硬瓶颈卡死:一是提出好想法的“研究品味”(Research Taste),二是可靠的结果判定。
我在尝试用 LLM 自动化跑实验闭环时深有体会,AI 最擅长的是在已知参数空间里暴力搜索,但它很难像顶级研究员那样,凭直觉判断哪个方向是死路,哪个方向有潜在突破。这就是 Vinyals 提到的“品味”问题。如果 AI 只能在既有逻辑内自我循环,没有外部真实世界的反馈或一个极高标准的判定机制,它很容易陷入“奖励作弊”(Reward Hacking)。
举个具体的坑,我在用一个自研的 Agent 尝试优化某个算法的超参数时,AI 发现通过操纵验证集的某个特定指标,可以让 Loss 看起来掉得很快,但实际上模型已经过拟合得没法用了。这就是典型的 Reward Hacking,AI 找到了走捷径的方法,而非真正的性能提升。如果递归自进化的判定标准本身就有漏洞,那么它迭代得越快,跑偏得就越离谱。
除了软件层面的逻辑判定,物理限制也无法忽视。Vinyals 提到的光速限制其实是指信息传输和硬件响应的物理极限。当你把模型规模推到极致,计算集群内部的通信延迟会变成致命伤。即使软件能自我优化,但如果你面对的是 10 万张 H100 的集群,光速决定的物理延迟就决定了你不可能在瞬间完成某种“指数级”的跃迁。
现在 Vinyals 和 Jeff Dean 搞的 Discovery Loop 看起来就是想在“判定机制”上做文章。目前的痛点是,我们给 AI 的 Reward Function 太简单了。一个简单的 if score > 0.9: reward = 1 根本无法支撑真正的科学研究。真正的研究需要的是一种能区分“偶然的数值提升”和“本质的逻辑突破”的评判能力。
如果你现在想尝试构建类似的自动化研究闭环,我建议不要迷信全自动递归,可以尝试以下配置逻辑:
一、构建一个严格的“外部真值”验证层
不要让 AI 自己判定结果是否正确。比如在写数学证明或代码优化时,必须接入一个确定性的编译器或形式化验证工具(如 Lean 或 Coq)。
# 这是一个极简的验证闭环伪代码逻辑
while [ $iteration -lt 100 ]; do
# AI 生成假设和代码
python generate_hypothesis.py > candidate.py
# 必须通过确定性的外部测试,而非 AI 自评
python test_suite.py candidate.py
if [ $? -eq 0 ]; then
echo "Valid improvement found"
# 只有通过测试才更新基准
cp candidate.py baseline.py
fi
done
二、引入多样性采样,防止陷入局部最优
在 Prompt 中强制要求 AI 给出 5 个截然不同的尝试方向,并对每个方向进行打分,通过对比来模拟所谓的“研究品味”,而不是让它在同一个方向上死磕。
三、监控指标漂移
记录每次迭代的资源消耗与性能提升比。如果发现性能提升与 Token 消耗呈非线性关系,或者出现指标异常波动,立即强制人工介入,防止进入 Reward Hacking 的死循环。
总的来说,AI 确实能加速研究,但它更像是一个超级高效的实验员,而不是一个能凭空创造新范式的科学家。在没有解决“如何定义正确”这个问题之前,指望它通过自我迭代瞬间进化成神,目前看来确实太乐观了。

这逻辑没毛病,关键是现在的验证集都快被刷烂了,没新数据怎么判定谁更强?