用 RA-GRPO 这种反向反思机制优化扩散模型能有效解决 Rewa
之前的 policy gradient 方法在探索空间时效率太低,很容易在某个高分但并不真实的区域打转。RA-GRPO 的核心逻辑是在优化过程中加入一个“反向反思”环节。具体操作上,它引入了 Diffusion Reflection,通过一个弱估计器把扩散过程给反转回去,去修正那些中间采样轨迹。你可以把它理解为在生成路径上加了一个校准器,强行把那些跑偏的潜状态(latent states)往真实数据的流形区域拉回来。
最让我觉得实用的一点是它搞了一个 Counterfactual Path Synthesis(反事实路径合成)。很多带搜索或修正的机制在推理的时候非常慢,因为得反向跑一遍。但 RA-GRPO 把这些修正后的轨迹通过隐式蒸馏的方式直接塞回了 policy 里面。这意味着模型在训练阶段经历了“生成-反思-修正”的循环,但到了实际推理生成图像或视频的时候,它依然是标准的 forward 流程,没有任何额外的计算开销。
我在分析它的实验结论时发现,这种方法在 T2I(文生图)和 T2V(文生视频)上的表现都比之前的对齐方法稳。尤其是解决 Reward Hacking 这个问题,因为有了反向轨迹的约束,模型很难通过制造一些奇怪的视觉噪声来骗分。
如果要尝试复现或者在自己的 pipeline 里集成,可以关注这几个关键步骤:
一、构建弱估计器进行 Diffusion Reflection
首先需要定义一个能将当前采样状态反向映射回原空间的估计器。在优化循环中,当模型生成一个样本且获得 Reward 分数时,不直接更新梯度,而是先利用这个估计器对中间的采样轨迹 $\epsilon_\theta(x_t, t)$ 进行反向修正,找出一条概率更高、更符合数据分布的路径。
二、执行反事实路径合成
将修正后的轨迹作为正样本,原有的采样轨迹作为对比样本。通过一个目标函数将这两者的差异最小化,让模型学习到“如果我刚才那样走会更好”的逻辑。具体的优化目标可以参考类似 GRPO 的组相对策略优化,但在计算优势函数(Advantage)时,要把反思后的路径增益考虑进去。
三、集成到现有扩散模型
由于 RA-GRPO 是架构无关的(architecture-agnostic),它不需要修改 UNet 或 Transformer 的结构,只需要在后训练(post-training)阶段替换掉原有的 RL 优化器。
- 语义忠实度: 相比传统的 RLHF,RA-GRPO 在复杂 Prompt 的还原度上提升明显,因为它在优化时强制对齐了数据流形。
- 视觉真实感: 减少了过度优化带来的“塑料感”或过度饱和现象。
- 推理成本: 零增加,因为所有的反思逻辑都留在训练阶段。
这种“先后退再前进”的思路其实给视觉生成对齐提供了一个很稳的方案,不再是单纯地在结果端做选择题,而是在路径端做修正题。