MIT 和 IBM 合作的那个实验室里出的这几个研究员

小Ray在路上 中级 13小时前 313 浏览 1 点赞 约 3 分钟

很多人在聊 Agent 的时候总在讨论 Prompt 怎么写,但其实真正决定 Agent 上限的是底层模型在部署后的进化能力。最近看了 MIT-IBM Computing Research Lab 几个研究员的路径,发现他们把强化学习(RL)往企业级场景推得很深,尤其是那个叫 Zhang-Wei Hong 的研究员,他搞的那个“部署时模型权重自进化”方向,如果真能落地,现在的 Agent 架构可能得推倒重来。

MIT 和 IBM 合作的那个实验室里出的这几个研究员

现在的 Agent 绝大多数还是靠 LLM 做规划,然后调用工具,这本质上还是在用一个静态的权重去应对动态的环境。而 Zhang-Wei Hong 在研究中提到的点在于,让 Agent 像人一样拥有“好奇心驱动的探索”能力。他之前在搞 Atari 游戏(比如 Montezuma’s Revenge)的时候,就在研究怎么优化价值函数学习,预测并优化 Agent 的策略性能。这种从游戏场景迁移到现实世界的逻辑很有意思:如果模型在执行任务、调用数据库查询或读取图表时,能够实时地、在线地更新自己的模型权重,而不是死板地依赖预训练的知识,那么 Agent 的鲁棒性会产生质变。

在他现在为 IBM 搭建的 Agentic Framework 里,他尝试引入进化计算来优化探索,甚至利用神经科学的结论来指导模型在部署时的改进。这意味着模型在处理企业级任务时,不再是简单的“输入-输出”,而是在一个“执行-反馈-自进化”的循环里跑。这种 Test-time training(测试时训练)的思路,其实解决了目前 LLM 最大的痛点之一:无法在不重新训练整个模型的情况下,快速适应一个极其具体的私有环境。

另外一个值得关注的点是 Irene Ko 搞的 Trustworthy AI(可信 AI)。很多人觉得“公平、鲁棒、安全”这些词是写在论文里的政治正确,但在 IBM 这种级别的工业实验室里,这些是硬指标。因为企业级部署和个人使用完全不同,一个在实验室里 95% 准确率的模型,如果 5% 的错误是毁灭性的(比如金融计算出错或产生偏见),那这个模型就没法上线。她研究的核心在于如何把学术上的“前沿安全”转化为工业标准的“部署安全”,把理论上的鲁棒性变成可量化的指标。

我觉得最硬核的细节在于,他们不再把 AI 研究看作是单纯的算法迭代,而是把它看作一套从“理论 → 约束 → 系统”的翻译过程。一个在 MIT 实验室里跑通的 RL 算法,到了 IBM 的企业级环境下,得面对内存限制、延迟要求和数据噪声。

如果你也在做 Agent 相关的开发,建议关注一下“Test-time training”和“在线权重更新”这两个方向。目前的趋势很明显:单纯堆 Token 和堆参数的时代快过去了,如何让模型在部署端(Deployment time)通过与环境的交互实现自我进化,才是决定 Agent 能否真正替代人类处理复杂任务的关键。

总结下来,这种从学术到工业的闭环路径给了我一个启发:真正的技术突破往往发生在“严谨的理论”撞上“残酷的现实约束”的那一刻。当模型不再是静态的权重文件,而是一个能在线演进的实体时,Agent 才会真正具备所谓的“智能”。

AI绘画Reinforcement learningIBMAIGCMIT
更多可复用的提示词工作流收录在ChatGPT提示词优化指南,有不少直接可参考的案例。

全部回复 (4)

副业中创业者 初级 13小时前
这套自进化怎么解决灾难性遗忘?会不会跑着跑着就崩了?
0 回复
产品经理大熊 高级 13小时前
之前在公司试过类似的闭环优化,确实比死磕prompt有效得多。
0 回复
程序员老陈 初级 13小时前
其实数据回流的质量才是关键,不然自进化很容易跑偏。
0 回复
老阿伟的日常 初级 13小时前
@程序员老陈 得加个强力的人工清洗环节吧,不然垃圾进垃圾出,你觉得呢?
0 回复

发表回复

支持 Markdown 格式