长程Agent强化学习崩溃的原因:BEACON实战分析
长程任务(Long-Horizon)在RL训练中经常出现“性能悬崖”,任务步数一长,模型表现直接崩掉。浙大ZJU-REAL最近出的这篇关于BEACON的论文把这个问题剖析得很透,核心在于揭示了为什么像GRPO这类轨迹级RL在处理复杂任务时会失效。
下一篇
GPT-2 XL在2024年还能跑出什么感觉? →
为什么长程RL会崩溃?
论文通过Qwen2.5-1.5B在ALFWorld上的实测,把崩溃归结为两个可量化的痛点:
- 信用分配错误(Credit Misattribution): GRPO把整条轨迹看作扁平序列,共享一个最终得分。这导致同一个动作在成功轨迹中拿正向梯度,在失败轨迹中拿负向梯度。论文定义的CAR(矛盾动作率)竟然高达40%以上,这意味着近一半的梯度更新在互相抵消,有效学习信号直接掉到20%以下。
- 样本利用率极低: 在长任务中,大量样本处于“部分成功”状态(完成了部分子目标但没最终成功)。在传统RL里,部分成功和完全失败都被判为0分,导致超过73%的样本根本不产生学习信号。
BEACON的解法:里程碑分解
核心逻辑是利用“里程碑马尔可夫属性”:一旦达成某个关键状态(比如拿到了钥匙),后续的成功只取决于接下来的操作,而与之前怎么拿到钥匙无关。
BEACON的操作流程分为三步:
一、里程碑切分
使用一个检测器 $\Phi$ 实时监控环境反馈,在状态发生可验证转移时将轨迹切分成段。最硬核的是 $\Phi$ 不需要人工标注,直接读取环境状态。
二、分段奖励塑造
在每个段内重新定义奖励,让模型在达成子目标时就能获得正反馈,而不是死等最后的 terminal reward。
三、双尺度优势估计
同时在段内(Segment-level)和全轨迹(Trajectory-level)两个尺度计算优势函数,确保局部优化不偏离全局目标。
实测结果
在ALFWorld长任务上的提升非常明显:成功率从 53.5% → 92.9%,样本有效利用率从 23.7% → 82.0%。最关键的是,任务越长,这种方法的优势越明显。
对于想要部署复杂AI Agent的开发者来说,这给了一个重要启示:不要试图用一个扁平的奖励函数去覆盖所有步骤,把长链路拆解为可验证的里程碑才是实操中的正确路径。
如果想看具体实现,可以参考他们的代码仓库:
github.com/ZJU-REAL/BEACON