长程Agent强化学习崩溃的原因:BEACON实战分析

产品经理大熊 高级 2天前 516 浏览 10 点赞 约 2 分钟

长程任务(Long-Horizon)在RL训练中经常出现“性能悬崖”,任务步数一长,模型表现直接崩掉。浙大ZJU-REAL最近出的这篇关于BEACON的论文把这个问题剖析得很透,核心在于揭示了为什么像GRPO这类轨迹级RL在处理复杂任务时会失效。

为什么长程RL会崩溃?

论文通过Qwen2.5-1.5B在ALFWorld上的实测,把崩溃归结为两个可量化的痛点:

  • 信用分配错误(Credit Misattribution): GRPO把整条轨迹看作扁平序列,共享一个最终得分。这导致同一个动作在成功轨迹中拿正向梯度,在失败轨迹中拿负向梯度。论文定义的CAR(矛盾动作率)竟然高达40%以上,这意味着近一半的梯度更新在互相抵消,有效学习信号直接掉到20%以下。
  • 样本利用率极低: 在长任务中,大量样本处于“部分成功”状态(完成了部分子目标但没最终成功)。在传统RL里,部分成功和完全失败都被判为0分,导致超过73%的样本根本不产生学习信号。

BEACON的解法:里程碑分解

核心逻辑是利用“里程碑马尔可夫属性”:一旦达成某个关键状态(比如拿到了钥匙),后续的成功只取决于接下来的操作,而与之前怎么拿到钥匙无关。

BEACON的操作流程分为三步:

一、里程碑切分
使用一个检测器 $\Phi$ 实时监控环境反馈,在状态发生可验证转移时将轨迹切分成段。最硬核的是 $\Phi$ 不需要人工标注,直接读取环境状态。

二、分段奖励塑造
在每个段内重新定义奖励,让模型在达成子目标时就能获得正反馈,而不是死等最后的 terminal reward。

三、双尺度优势估计
同时在段内(Segment-level)和全轨迹(Trajectory-level)两个尺度计算优势函数,确保局部优化不偏离全局目标。

实测结果

在ALFWorld长任务上的提升非常明显:成功率从 53.5% → 92.9%,样本有效利用率从 23.7% → 82.0%。最关键的是,任务越长,这种方法的优势越明显。

对于想要部署复杂AI Agent的开发者来说,这给了一个重要启示:不要试图用一个扁平的奖励函数去覆盖所有步骤,把长链路拆解为可验证的里程碑才是实操中的正确路径。

如果想看具体实现,可以参考他们的代码仓库:

github.com/ZJU-REAL/BEACON
AI大模型LLMagents

全部回复 (3)

咖啡续命折腾党 中级 2天前
这个milestone验证怎么实现最稳?我之前跑长链条任务的时候,最怕这种悄悄崩掉的情况,最后查日志能查到头秃。
0 回复
养生全栈 中级 2天前
那如果把任务拆细一点做分段奖励,还能缓解崩溃吗?
0 回复
数据分析师小美 初级 2天前
其实奖励函数设计太粗糙也会这样,之前调参数被坑惨了。
0 回复

发表回复

支持 Markdown 格式