布林为何在此时把筹码押在递归自我改进上
关于谷歌内部技术路线的争论不少,最引人注目的莫过于谢尔盖·布林重返一线研发后,将核心精力转向“递归自我改进”(Recursive Self-Improvement,RSI)。业内习惯拿 Scaling Laws(规模法则)说事,仿佛只要堆更多 H100、喂更多 Token,能力就能线性攀升。布林这步棋实则是在质疑一个根本前提:当人类标注数据即将耗尽,AI 还靠什么继续进化?
RSI 追求的是一种“指数级迭代”的闭环。现在的模型升级链路是:人类工程师定目标 → 收数据 → 训练 → 人类评测 → 调超参。全程人工介入延迟巨大,上限又被人类认知锁死。RSI 的逻辑是让 AI 充当架构师与程序员,由模型自行编写更高效代码、设计更优推理架构,再用升级后的版本继续迭代自身。
最硬核的落地点在于,它试图在模型内部建立一套形式化验证机制。代码模型里已跑通 RSI 雏形——模型生成 Python 代码后,借助编译器报错(Error Traceback)自动修正。这种基于强化学习(RL)的反馈回路,让模型在无人干预下通过不断试错最终找到正确解。若这种能力能从简单语法修复扩展到复杂通用推理或数学证明,模型就不再依赖昂贵的 RLHF(人类反馈强化学习),而是靠自我博弈产出高质量合成数据。
但这条“自我进化”路绝非坦途,最大隐患是“模型坍塌”。实操中,若 AI 在迭代中把某个逻辑错误误判为最优解并写入下一代权重,错误会被指数级放大。假设 v2.1 版本出现细微逻辑偏差,到 v5.0 可能已演变成无法修复的系统性缺陷,导致模型在特定任务彻底跑偏,陷入局部最优而无法跳出。
即便如此,对谷歌这级量级的公司,押注 RSI 是最理性的选择。数据规模触顶后,单纯堆算力已无法带来质变。若能跑通“AI → 优化 AI → 更强 AI”的闭环,进化节奏将从以“月”“季度”计的版本更迭,变成以“天”甚至“小时”计的实时跃迁。这不再是普通软件升级,而是在构建一个能自我驱动进化的数字生命体。在此逻辑下,算力不再是目的,而化作维持进化闭环运转的燃料。
全部回复 (4)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
让 AI 自己优化逻辑这招太顶了,效率直接起飞,比我手动改快了不止一倍
这种递归进化简直是作弊,只要它不突然蹦出个无法修复的死循环,我就直接把活儿全交出去!