用 CriticGen 把大模型评价改成可执行的反馈比泛泛而谈的打分管用多了

咖啡续命折腾党 中级 2天前 287 浏览 11 点赞 约 3 分钟

直接说结论,如果你还在用那种「请给这个回答打分并给出理由」的 Prompt,你会发现 AI 给的反馈极其笼统,比如「逻辑不够严谨」或「缺乏细节」,这种话对优化结果毫无帮助。CriticGen 这种把评价维度动态化、把反馈变成「可执行指令」的思路,能让 73.17% 的回答在修正后质量提升,且 93.28% 的案例没有出现越改越烂的情况。

为什么之前的 LLM 评分是无效的

在公司内部跑 RAG 效果评估时,我最头疼的就是让 GPT-4o 做裁判。它经常给我打个 3 分,理由写「回答不够全面」,但我面对这个理由完全没法操作——我不知道具体少了哪个知识点,也不知道怎么改能让它变 4 分。这就是典型的「解耦评价」,评价过程和生成过程是分开的,评价结果是粗粒度的。

CriticGen 解决这个问题的核心在于它不使用统一的评分标准,而是针对每一个具体的样本,先生成一套「临时评分量表(Rubric)」。

CriticGen 怎么把评价变成指令

这个框架的操作逻辑不是直接打分,而是分两步走:

一、动态生成样本特定的评价维度
它不会直接问「好不好」,而是先分析这个样本属于什么类型。如果是客观题,它会生成关于「事实准确性」的细分维度;如果是主观题,则生成「论点覆盖度」等维度。
它会把约束条件分为三类:主观约束、客观约束和自推导约束。这意味着对于每一个特定的输入,AI 会先给自己定一套极其具体的「打分细则」,而不是套用一个全局的模版。

二、将理由转化为可执行的 Refinement Suggestion
这是最关键的增量。它要求模型在输出分数和理由的同时,必须给出一个「可执行的修改建议」。

  • 错误示范(传统评价):理由是「缺乏细节」,建议是「请补充更多细节」。
  • CriticGen 模式:理由是「未提及 2024 年 Q3 的财报数据」,建议是「在第二段末尾加入关于营收增长 5% 的具体数值」。

这种细粒度的控制让模型在进行 Answer Improvement 时,有了明确的指令路径,而不是在猜测评分者的意图。

实测数据看提升幅度

从 arXiv 2609.05439v1 的实验结果看,这种方案的有效性体现在几个具体的数字上:

  • 评价的相关性: Pearson 相关系数达到了 0.9556,Spearman 相关系数 0.9560。这意味着它生成的动态量表与人类专家的判断高度一致,比那些死板的打分表精准得多。
  • 反馈的质量: 针对「基于准则的理由」和「可执行建议」的 F1 分数,从 0.6369/0.5994 提升到了 0.7554/0.7900。这意味着 AI 给出的修改建议不再是废话,而是真正能落地、能对齐准则的指令。
  • 实际修正率: 73.17% 的答案在经过这种反馈修正后得到了提升,而且非退化率(Non-degradation rate)高达 93.28%。这意味着你敢放心让它根据这个反馈去改,不用担心它把原本对的部分给改错了。

落地到公司业务时的避坑建议

如果想在团队里复刻这个逻辑,不要直接写一个大 Prompt 完事,建议拆分成 Pipeline:

pipeline:
  step_1_rubric_gen:
    input: "user_query + model_answer"
    output: "specific_scoring_criteria" # 针对此样本生成具体量表
  step_2_eval_and_suggest:
    input: "specific_scoring_criteria + model_answer"
    output: "score + reason + executable_action" # 必须包含具体执行动作
  step_3_refine:
    input: "executable_action + model_answer"
    output: "refined_answer" # 执行动作进行修正

这里有个坑:在 step_2 生成 executable_action 时,一定要强制要求模型使用「动词 + 具体缺失项」的结构。如果模型还是习惯性输出「建议优化语言」,直接在 Prompt 里通过 Few-shot 告诉它这是无效反馈,强迫它写出类似「将第三段的 X 替换为 Y」这种指令。

这种方案的成本会比单次打分高,因为你把一次调用变成了三次(生成量表 -> 评价建议 -> 修正答案),但对于追求极致质量的生产环境,这种用 Token 换质量的方案比盲目调 Prompt 效率高得多。

工作流AI落地arxivCriticGenLLM-Evaluation

全部回复 (4)

老陈 专家 2天前

这提升率有点离谱,是用 GPT-4o 跑的还是 Claude 3.5?

0 回复
夜猫子创业者 专家 2天前

这提升率看得我心慌,要是用 3.5 跑出这结果,那 4o 岂不是在浪费电?

0 回复
数据分析师小美 初级 2天前

这种动态维度要是能对齐到具体的业务指标上就无敌了,现在最怕它在那儿瞎指挥导致模型幻觉。

0 回复
数据分析师Neo 专家 2天前

早该这样了,我上周用打分法调 Prompt 调到崩溃,结果它一直给我打 8 分却说没细节,这种废话真的能把人搞疯,CriticGen 跑起来快吗?

0 回复

发表回复

支持 Markdown 格式