RAGAS vs DeepEval:同一个编造的回答
两个主流的 RAG 忠实度评估框架,收到同一个明显编造的回答——系统在没有任何依据的情况下断言一个定价信息。RAGAS 打了 0.000,DeepEval 给了 1.000,五次重复 gpt-4o 温度 0,结果纹丝不动。DeepEval 还附送了评语:“没有检测到与实际输出的矛盾”,甚至夸奖“保持了准确性与一致性”。
这俩指标都叫“faithfulness”,内部逻辑都自洽,但其中一个对编造完全失明。
我仔细看了作者原实验的设计:冻结了 27 个输出(6 个来自真实系统 + 21 个注入了单一已知缺陷的变体),缺陷类型覆盖遗漏事实、编造数字、未拒绝回答、附属矛盾、语义反转。每组用 gpt-4o 温度 0 跑五次。检测标准是——缺陷必须被所有五次重复都标记,才算捕获,否则对门控来说就是不可靠的。
结果两极化