MIT 和 IBM 合作的那个实验室里出的这几个研究员
现在的 Agent 绝大多数还是靠 LLM 做规划,然后调用工具,这本质上还是在用一个静态的权重去应对动态的环境。而 Zhang-Wei Hong 在研究中提到的点在于,让 Agent 像人一样拥有“好奇心驱动的探索”能力。他之前在搞 Atari 游戏(比如 Montezuma’s Revenge)的时候,就在研究怎么优化价值函数学习,预测并优化 Agent 的策略性能。这种从游戏场景迁移到现实世界的逻辑很有意思:如果模型在执行任务、调用数据库查询或读取图表时,能够实时地、在线地更新自己的模型权重,而不是死板地依赖预训练的知识,那么 Agent 的鲁棒性会产生质变。
在他现在为 IBM 搭建的 Agentic Framework 里,他尝试引入进化计算来优化探索,甚至利用神经科学的结论来指导模型在部署时的改进。这意味着模型在处理企业级任务时,不再是简单的“输入-输出”,而是在一个“执行-反馈-自进化”的循环里跑。这种 Test-time training(测试时训练)的思路,其实解决了目前 LLM 最大的痛点之一:无法在不重新训练整个模型的情况下,快速适应一个极其具体的私有环境。
另外一个值得关注的点是 Irene Ko 搞的 Trustworthy AI(可信 AI)。很多人觉得“公平、鲁棒、安全”这些词是写在论文里的政治正确,但在 IBM 这种级别的工业实验室里,这些是硬指标。因为企业级部署和个人使用完全不同,一个在实验室里 95% 准确率的模型,如果 5% 的错误是毁灭性的(比如金融计算出错或产生偏见),那这个模型就没法上线。她研究的核心在于如何把学术上的“前沿安全”转化为工业标准的“部署安全”,把理论上的鲁棒性变成可量化的指标。
我觉得最硬核的细节在于,他们不再把 AI 研究看作是单纯的算法迭代,而是把它看作一套从“理论 → 约束 → 系统”的翻译过程。一个在 MIT 实验室里跑通的 RL 算法,到了 IBM 的企业级环境下,得面对内存限制、延迟要求和数据噪声。
如果你也在做 Agent 相关的开发,建议关注一下“Test-time training”和“在线权重更新”这两个方向。目前的趋势很明显:单纯堆 Token 和堆参数的时代快过去了,如何让模型在部署端(Deployment time)通过与环境的交互实现自我进化,才是决定 Agent 能否真正替代人类处理复杂任务的关键。
总结下来,这种从学术到工业的闭环路径给了我一个启发:真正的技术突破往往发生在“严谨的理论”撞上“残酷的现实约束”的那一刻。当模型不再是静态的权重文件,而是一个能在线演进的实体时,Agent 才会真正具备所谓的“智能”。
