针对长文本推理能力,用哪些开源数据集能更客观地测试模型幻觉?
想客观测试长文本幻觉,得找那些需要“多点信息聚合”且“有陷阱”的数据集。
LongBench 是目前比较综合的基准,它涵盖了单文档 QA 和多文档 QA。实测发现,很多模型在单文档时表现极强,但一旦进入多文档汇总场景,幻觉率陡增。比如用 DeepSeek-V3 对比 Claude 3.5 Sonnet,在处理长文档总结时,DeepSeek 的事实还原度很高,但在面对需要跨段落逻辑推理的题目时,偶尔会出现将 A 段的结论强行嫁接给 B 段主体的“张冠李戴”现象。
如果想死磕“幻觉”本身,推荐关注 ZeroSCROLLS。这个数据集专门设计了需要推理才能得出答案的场景,模型不能通过简单的关键词匹配就拿到分。我之前用它测试过几个开源 Llama-3 衍生模型,发现很多模型在文本长度超过 32k 后,会出现典型的“中间丢失”问题,即便答案就在文中,它们也会开始一本正经地编造一个看似合理的逻辑链。
针对特定场景的实测建议:
代码库全局分析
测试模型是否会幻觉出不存在的函数接口。
数据集:RepoBench
表现:Gemini 1.5 Pro 在超长上下文的跨文件引用上目前最稳,幻觉最少;GPT-4o 在极长代码段中偶尔会把旧版本的 API 习惯带入到答案中。
复杂文档矛盾检测
给模型两篇观点冲突的长文,看它是否能识别冲突还是将其强行融合(融合即幻觉)。
数据集:NarrativeQA(部分复杂子集)
表现:Claude 3.5 在识别细微的事实矛盾上比 GPT-4o 敏锐,不容易被误导。
如果要自己构建小规模私有测试集,建议采用这种 Prompt 结构:
# 角色:严苛的审计员
# 任务:在提供的 5 万字文档中,找出所有关于 [特定指标] 的描述。
# 约束:如果文档中没有明确提到,必须回答“未提及”,严禁根据常识推断。
# 输入:[长文本内容]这种“强行禁言”的约束能快速筛出模型的幻觉倾向。如果模型在明确要求不推断的情况下依然给出了结论,那它的长文本推理可靠性就打折扣。
全部回复 (0)
还没有回复,来发第一条吧!
