跳转至

AI 充当评审(LLM-as-Judge)

概述

AI 充当评审——也称 LLM 充当评审(LLM-as-judge)——是指用一个 AI 模型来评测另一个 AI 模型的输出。承担评测角色的 AI 模型称为 AI 评审。截至 2024 年,它已成为生产环境中评测基础模型(foundation model)输出最常用的方法之一。背后的驱动因素是:人工评测在大规模下难以为继,而 LLM 输出的开放式特性又让 exact match(完全匹配)等传统指标失效。

LangChain 的 2023 State of AI 报告发现,其平台上 58% 的评测使用了 AI 评审。2023—2024 年间演示的大多数 AI 评测创业公司,都以某种形式依赖 AI 充当评审。

为什么要用 AI 充当评审?

传统机器学习评测在封闭式任务(分类、命名实体识别)上表现良好——这类任务的输出可以与标准答案(ground truth)逐一核对。但基础模型产出的是开放式输出:同一个问题往往有多个有效答案,这让基于完全匹配和重合度的指标(BLEU、ROUGE)力不从心。

AI 评审引入类似人类的灵活判断,正好弥补了这一点:

  • 无需参考数据:可在没有预先标注标准答案的生产环境中评测
  • 任意标准:可评判正确性、相关性、毒性、忠实度、语气、健康性、安全性以及自定义的领域标准
  • 快速且经济:相比人工标注员,成本和速度都低出数个量级
  • 可解释:能给出打分理由,从而支持对评测决策的审计
  • 与人类判断相关:在 MT-Bench 上,GPT-4 与人类评测者的一致率达 85%(Zheng et al., 2023),略高于人类之间的一致率(81%)。AlpacaEval 评审与人工评测的 LMSYS Chatbot Arena 排行榜呈现近乎完美的相关性(0.98)。

如何使用 AI 充当评审

三种核心使用模式:

1. 绝对打分(Absolute Scoring)

在没有参考数据的情况下,对单个回答按标准进行评测。

Given the following question and answer, evaluate how good the answer is.
Score from 1 to 5 (1 = very bad, 5 = very good).
Question: [QUESTION]
Answer: [ANSWER]
Score:

2. 参考对比(Reference Comparison)

将生成的回答与参考(标准答案)回答进行对比。

Given the question, reference answer, and generated answer below, evaluate
whether the generated answer conveys the same meaning as the reference.
Output True or False.
Question: [QUESTION]
Reference: [REFERENCE ANSWER]
Generated: [GENERATED ANSWER]

3. 成对对比(Pairwise Comparison)

对比两个回答,判断哪个更好或用户更偏好哪个。用于 RLHF 偏好数据采集和排行榜排名。

Given the question and two answers below, which answer is better?
Output A or B.
Question: [QUESTION]
A: [FIRST ANSWER]
B: [SECOND ANSWER]
The better answer is:

AI 评审的提示词设计

一个 AI 评审是一套系统——模型加提示词(prompt)。提示词必须清晰地说明:

  1. 任务:评审要评测什么(例如「评测问题与答案之间的相关性」)
  2. 标准:详细解释该标准的含义(例如「相关性指答案依据标准答案、以充分的信息回应了问题」)
  3. 打分体系:根据评审模型擅长的形式来选择:
  4. 分类(好/坏、相关/不相关)——最可靠
  5. 离散数值(1—5)——效果良好;避免过宽的取值区间
  6. 连续值(0—1)——最不可靠;尽量优先用离散值
  7. 示例:给出带评分的示例。Zheng et al. (2023) 表明,这能把 GPT-4 的一致性从 65% 提升到 77.5%。

关键原则:AI 评审更擅长文本分类,而非数值打分。离散量表(1—5)优于连续量表。量表越宽,难度越大。

常见的内置标准

工具 内置标准
Azure AI Studio 接地性、相关性、连贯性、流畅度、相似度
MLflow 忠实度、相关性
LangChain Criteria 简洁性、相关性、正确性、连贯性、有害性、有用性、争议性
RAGAS 忠实度、答案相关性

警告:各工具之间的标准并不统一。MLflow 中的「忠实度」(1—5 量表)不同于 RAGAS(0 或 1)和 LlamaIndex(YES/NO)。在确认提示词与量表一致之前,切勿跨工具比较分数。

局限

不一致性

AI 评审是概率性的。同一个评审对同一份输入运行两次,可能输出不同的分数。这会削弱可复现性和可信度。缓解办法:使用更低的 temperature、加入少样本(few-shot)示例、运行多次并做聚合。

自我偏好(位置偏好与长度偏好)

AI 评审往往会: - 偏好自己的输出:在评判与另一个模型回答的对比时倾向于自家输出 - 偏爱更长的回答:即便更短的回答更准确(GPT-4 已被证明存在这一倾向,PALM-2 亦然;Saito et al., 2023) - 偏好处于第一位的回答:在成对对比中如此

缓解办法:交换回答顺序并对分数取平均;在提示词中显式惩罚长度;使用来自不同模型家族的评审。

标准的模糊性

在缺乏标准化标准的情况下,同一个标准名称在不同工具中可能衡量的是不同的东西。在比较评测结果之前,务必检视底层的评审提示词。

成本与延迟

AI 充当评审会为每次评测至少增加一次额外的模型调用。对于高吞吐量的生产系统,这会显著成倍放大推理成本。缓解办法:只评测一个采样(例如 1—5%),而非全部流量;常规检查用更便宜的评审,回归测试用更强的评审。

天花板问题

对于现有最强的模型,没有比它本身更强、合格的评审可用。比较类方法(Chatbot Arena)通过大规模聚合人类偏好,在一定程度上缓解了这一问题。

哪些模型可以充当评审?

三种配置:

评审强度(相对被评模型) 应用场景 优劣
更强的评审 主要的生产评测 准确性更好;成本更高;最强模型没有合格的评审
同等强度的评审 交叉验证 可行;需警惕模型家族偏好
自评测(自我批判) 健全性检查;回答修订 快;易受自我偏好影响;适合触发重新生成
专用的弱评审 高吞吐量的常规检查 成本低;针对特定标准训练;可能漏掉通用质量问题

推荐做法:离线评测和回归测试用更强的模型。生产环境采样用同等强度或专用评审。部署前,所有评审都应在一个有代表性的留出(hold-out)集上,与人工标注进行验证。

比较式评测与模型排名

比较式评测——让评测者(人类或 AI)从两个回答中挑出更好的一个——会产出成对偏好数据。Elo 风格的排名(如 LMSYS Chatbot Arena 所采用)将成对结果聚合为一个稳定的排行榜。

何时使用比较式评测: - 主观的质量评判(风格、有用性、语气) - 在多个模型或提示词变体之间做选择 - 采集 RLHF 偏好训练数据

何时不要使用比较式评测: - 有客观正确答案的事实性问题——偏好投票可能产生错误信号 - 对话式 UX 场景——要求用户做选择会带来摩擦

最佳实践

挑战 建议
分数不一致 降低 temperature;加入少样本示例;多次运行并取平均
位置/长度偏好 随机化回答顺序;交换并取平均;在提示词中惩罚长度
跨工具的标准漂移 锁定评审提示词与模型版本;将两者一并存入受版本管理的评测配置
评测成本 生产环境采样 1—5%;常规信号用更便宜的专用评审
生产环境无标准答案 用 AI 评审 + 隐式信号(点击、追问)作为互补信号
评审验证 在信任评审之前,务必在留出集上将评审分数与人工标注做相关性核对

参见

参考资料