RAG 里的多步推理要是中间一步检索错了,后面全盘皆输
做 RAG(检索增强生成)的时候最头疼的就是多步推理(Multi-hop reasoning)。现在的优化逻辑大多是 Outcome-based,也就是只看最后给出的答案对不对。这有个致命逻辑漏洞:如果模型中间检索的内容全是垃圾,但最后靠着某种“玄学”或者模型自带的知识撞对了答案,传统的奖励机制(Reward)会觉得这一整套流程都很完美。这种“歪打正着”的伪成功,会让模型在处理真正复杂的问题时彻底翻车。
传统的过程奖励模型(PRM)往往只看逻辑对不对,但 PRO-Step 要求模型在每一步都要同时评估两个维度:
为了让模型知道什么是“错的”,他们利用 PRM 引导的价值树搜索来构建对比样本。简单来说,就是把那些“检索错了但结果对了”的虚假步骤,和“检索对了且逻辑也对”的正向步骤放在一起做对比,强行让模型学会区分什么是真正的正确。
最后,他们不是在整个序列上做优化,而是直接在步骤级别(Step-level)跑 Direct Preference Optimization (DPO)。这样模型在训练时,每一小步的动作都能得到精准的反馈。
最近看到的这篇关于 PRO-Step 的论文正好在拆这个坑。他们提出了一种叫 Step-level Process Reward Optimization 的思路,核心在于不再只盯着终点,而是要把每一个推理步骤拆开来看。
我拆解了一下他们的技术路径,主要干了三件事:
1. 引入双维度的生成式 PRM
传统的过程奖励模型(PRM)往往只看逻辑对不对,但 PRO-Step 要求模型在每一步都要同时评估两个维度:
- 逻辑有效性(Logical Validity): 这步推理逻辑通顺吗?
- 证据支撑度(Evidential Grounding): 这步用的检索内容真的能支撑这个结论吗?
2. 基于价值树搜索(Value Tree Search)构造偏好对
为了让模型知道什么是“错的”,他们利用 PRM 引导的价值树搜索来构建对比样本。简单来说,就是把那些“检索错了但结果对了”的虚假步骤,和“检索对了且逻辑也对”的正向步骤放在一起做对比,强行让模型学会区分什么是真正的正确。
3. 步骤级的 DPO 优化
最后,他们不是在整个序列上做优化,而是直接在步骤级别(Step-level)跑 Direct Preference Optimization (DPO)。这样模型在训练时,每一小步的动作都能得到精准的反馈。
实验数据上看,PRO-Step 在五个 benchmark 上把 EM(精确匹配)和 F1 分数都刷到了比较高的高度。对于那种需要查好几轮资料才能回答问题的复杂 QA 场景,这种“纠错于微时”的思路确实比单纯堆模型参数要硬核得多。
代码和训练数据已经开源了,感兴趣可以去这里看:
https://github.com/keemminnke/PRO-Step 事件追踪 · 相关报道
AI 对齐这词,最近听得我耳朵都起茧了
13天前
免费 AI 工具箱 · 全部完全免费