如何构建一套针对垂直领域 RAG 效果的端到端评测集

独立游戏开发王 高级 2026/5/22 333 浏览 13 点赞 约 2 分钟

很多 RAG 项目在 Demo 阶段看起来很惊艳,但一旦接入真实业务数据就崩盘,核心原因就是缺乏一套量化的评测集,全靠人工随缘抽检。

如何构建一套针对垂直领域 RAG 效果的端到端评测集

实测下来,针对垂直领域(比如医疗、法律或企业内部文档),最坑的不是模型能力,而是检索质量。如果你直接用 GPT-4 做评测员,它很容易因为自身的常识而给检索错误但回答正确的结果打高分,这会导致你误以为 RAG 链路没问题,其实是模型在用自带知识“脑补”。

构建评测集建议走这条路:

1. 构造 Q-A-C 三元组
不要只写问题和答案,必须包含 Context(检索片段)。
Query: 用户实际会问的问题(含噪音、口语化)。
Answer: 标准答案(Ground Truth)。
Context: 能够支撑该答案的原文片段。
这样你才能把端到端评测拆解为:检索率(能否搜到 Context) → 生成质量(根据 Context 能否得出 Answer)。

2. 针对不同模型的评测表现
我对比了 DeepSeek-V3 和 GPT-4o 在评测集打分上的差异:
DeepSeek-V3: 对逻辑推演的严谨度要求极高,如果答案中缺失了一个关键限定词,它给的分数会掉得很厉害,适合对准确率要求极高的金融/工业场景。
GPT-4o: 倾向于给“看起来像正确答案”的内容打高分,语义覆盖面广,但有时会忽略细节错误。
Claude 3.5 Sonnet: 在判断回答是否基于上下文(Faithfulness)时最敏锐,能快速揪出模型幻觉。

3. 评测指标的落地方案
放弃复杂的数学公式,直接用 LLM-as-a-Judge,但 Prompt 必须极度具体。
不要问「这个回答好不好」,要问「回答中的 A 观点是否在 Context 的第 B 段中有直接证据」。

具体的评测 Prompt 结构参考:

# Role: 垂直领域文档审计员
# Task: 判定回答是否产生幻觉
# Criteria: 
1. 仅依据提供的 [Context] 判断。
2. 若 [Answer] 中包含 [Context] 以外的信息,即使该信息正确,也判定为 "幻觉"。
# Output: [Score: 0/1] + [Reason]

4. 避坑指南
不要用模型生成的合成数据直接做评测集。我之前试过用 GPT-4 根据文档生成 100 个 QA 对,结果发现模型在回答这些问题时有严重的“训练分布记忆”,导致评分虚高。最稳妥的办法是:从真实日志里抽 20% 的 Bad Case → 人工标注 → 扩充同类变体。

实测对比结论:
检索端:混合检索(BM25 + Vector)在垂直领域依然完胜纯向量检索,尤其是涉及专业术语时。
生成端:只要检索片段准确,DeepSeek 和 GPT-4o 的端到端效果差距在 5% 以内,瓶颈全在数据清洗和 Chunk 策略上。

全部回复 (0)

还没有回复,来发第一条吧!

发表回复

支持 Markdown 格式