多跳问答模型总在瞎编答案?试试这套证据充分性边界训练法

在深圳设计师 中级 3天前 792 浏览 0 点赞 约 3 分钟

在处理多跳问答(Multi-Hop QA)这种需要复杂逻辑推理的任务时,很多开发者都遇到过一个极其棘手的问题:模型在面对“半吊子证据”时非常容易产生幻觉。简单来说,当参考资料只提供了逻辑链条的一半信息时,模型往往不会选择承认证据不足,而是凭借强大的概率预测能力,强行拼凑出一个看起来极其专业但事实错误的答案。这种现象本质上是因为模型缺乏对“证据边界”的感知能力,它分不清什么时候信息量已经足够支撑结论,什么时候还处于猜测阶段。

最近关注到一篇关于 Evidence Sufficiency Boundaries(证据充分性边界)的论文,其核心思路非常硬核,它不再试图通过简单的 Prompt 引导让模型“诚实”,而是通过一套专门的训练框架,教模型识别从“证据不足”到“证据充分”的那个临界点。

传统的拒绝训练(Rejection Training)通常是二元论:要么给正确答案,要么给一个“我不知道”。但多跳问答的复杂之处在于,证据是逐步累积的。这篇论文提出的 Evidence Sufficiency Boundary Training 框架,实际上是在构建一个有序的证据链条。在训练过程中,研究者故意控制证据的呈现顺序,当证据链条处于不完整状态时,强制模型执行 Abstain(拒绝回答)指令;只有当证据链条达到一个特定的临界点——即所有必要的逻辑跳跃都被证据覆盖时,模型才被允许切换到 Answer 模式。

这种训练方式让模型产生了一种“边界感”。它不再是盲目地在 Token 层面猜测是否该拒绝,而是在推理过程中实时评估当前掌握的证据是否已经跨过了那个能够支撑答案的“边界”。

从实验数据来看,这种方法在实际落地中展现出了明显的优势。研究团队选用 Qwen2.5-3B-Instruct 作为底座模型,并采用 LoRA 进行轻量化微调。在衡量模型识别边界能力的关键指标 Flip Accuracy(翻转准确率,即模型能否在证据刚好补齐的那一刻精准地从拒绝转为回答)上,该方法达到了 0.807。相比之下,那些仅在 Token 层面进行简单拒绝训练的 Baseline 模型,其准确率仅为 0.781。虽然数字差距看起来不大,但在处理长链条推理时,这种边界感的提升直接决定了最终答案的可靠性。

最令我印象深刻的是它对幻觉的抑制能力。在面对完全无法通过提供资料回答的外部测试集时,该模型产生的 unsupported-answer rate(不支持性回答率)降低到了 0.095。这意味着模型在面对缺失关键证据的陷阱时,能够以极高的概率保持沉默,而不是一本正经地胡说八道。

对于我们开发复杂 AI Agent 的工程师来说,这套逻辑非常有参考价值。在构建 RAG(检索增强生成)系统时,我们经常纠结于检索召回率和生成准确率的平衡,但其实最关键的缺失环节点在于模型对“证据充分性”的自我判定。如果能将这种“从拒绝到回答”的平滑过渡机制引入到 Agent 的判断链路中,我们就能在保证答案质量的同时,极大降低系统在复杂业务场景下的幻觉率。

Qwen2.5HotpotQAMuSiQueMulti-Hop QA

全部回复 (4)

远程办公技术宅 中级 3天前
作者没提的是,这玩意儿对长文本检索要求极高,搜不到证据就更难练了。
0 回复
大熊爱学习 中级 3天前
@远程办公技术宅 确实,如果检索环节本身就带了噪声,那模型估计学出来的全是幻觉。
0 回复
早八人码农 专家 3天前
这法子对推理链太长的文档管用吗?感觉检索精度稍微差点还是会翻车。
0 回复
产品经理阿强 中级 3天前
我之前调模型也碰到过,明明资料里没写,它硬是靠语感编了个逻辑闭环,确实挺坑的。
0 回复

发表回复

支持 Markdown 格式