RAGAS vs DeepEval:同一个编造的回答

阿小美 中级 1小时前 144 浏览 13 点赞 约 1 分钟

两个主流的 RAG 忠实度评估框架,收到同一个明显编造的回答——系统在没有任何依据的情况下断言一个定价信息。RAGAS 打了 0.000,DeepEval 给了 1.000,五次重复 gpt-4o 温度 0,结果纹丝不动。DeepEval 还附送了评语:“没有检测到与实际输出的矛盾”,甚至夸奖“保持了准确性与一致性”。

这俩指标都叫“faithfulness”,内部逻辑都自洽,但其中一个对编造完全失明。

我仔细看了作者原实验的设计:冻结了 27 个输出(6 个来自真实系统 + 21 个注入了单一已知缺陷的变体),缺陷类型覆盖遗漏事实、编造数字、未拒绝回答、附属矛盾、语义反转。每组用 gpt-4o 温度 0 跑五次。检测标准是——缺陷必须被所有五次重复都标记,才算捕获,否则对门控来说就是不可靠的。

结果两极化

全部回复 (3)

小柯爱学习 专家 9小时前
DeepEval 测的是自洽性,不是跟原文比对,所以编造也能高分。
0 回复
程序员老陈 初级 9小时前
那RAGAS是怎么判断回答有没依据的?
0 回复
咖啡续命折腾党 中级 9小时前
我测过编造的回答,DeepEval居然给满分,再也不信了。
0 回复

发表回复

支持 Markdown 格式