AI 充当评审(LLM-as-Judge)
概述
AI 充当评审——也称 LLM 充当评审(LLM-as-judge)——是指用一个 AI 模型来评测另一个 AI 模型的输出。承担评测角色的 AI 模型称为 AI 评审。截至 2024 年,它已成为生产环境中评测基础模型(foundation model)输出最常用的方法之一。背后的驱动因素是:人工评测在大规模下难以为继,而 LLM 输出的开放式特性又让 exact match(完全匹配)等传统指标失效。
LangChain 的 2023 State of AI 报告发现,其平台上 58% 的评测使用了 AI 评审。2023—2024 年间演示的大多数 AI 评测创业公司,都以某种形式依赖 AI 充当评审。
为什么要用 AI 充当评审?
传统机器学习评测在封闭式任务(分类、命名实体识别)上表现良好——这类任务的输出可以与标准答案(ground truth)逐一核对。但基础模型产出的是开放式输出:同一个问题往往有多个有效答案,这让基于完全匹配和重合度的指标(BLEU、ROUGE)力不从心。
AI 评审引入类似人类的灵活判断,正好弥补了这一点:
- 无需参考数据:可在没有预先标注标准答案的生产环境中评测
- 任意标准:可评判正确性、相关性、毒性、忠实度、语气、健康性、安全性以及自定义的领域标准
- 快速且经济:相比人工标注员,成本和速度都低出数个量级
- 可解释:能给出打分理由,从而支持对评测决策的审计
- 与人类判断相关:在 MT-Bench 上,GPT-4 与人类评测者的一致率达 85%(Zheng et al., 2023),略高于人类之间的一致率(81%)。AlpacaEval 评审与人工评测的 LMSYS Chatbot Arena 排行榜呈现近乎完美的相关性(0.98)。
如何使用 AI 充当评审
三种核心使用模式:
1. 绝对打分(Absolute Scoring)
在没有参考数据的情况下,对单个回答按标准进行评测。
Given the following question and answer, evaluate how good the answer is.
Score from 1 to 5 (1 = very bad, 5 = very good).
Question: [QUESTION]
Answer: [ANSWER]
Score:
2. 参考对比(Reference Comparison)
将生成的回答与参考(标准答案)回答进行对比。
Given the question, reference answer, and generated answer below, evaluate
whether the generated answer conveys the same meaning as the reference.
Output True or False.
Question: [QUESTION]
Reference: [REFERENCE ANSWER]
Generated: [GENERATED ANSWER]
3. 成对对比(Pairwise Comparison)
对比两个回答,判断哪个更好或用户更偏好哪个。用于 RLHF 偏好数据采集和排行榜排名。
Given the question and two answers below, which answer is better?
Output A or B.
Question: [QUESTION]
A: [FIRST ANSWER]
B: [SECOND ANSWER]
The better answer is:
AI 评审的提示词设计
一个 AI 评审是一套系统——模型加提示词(prompt)。提示词必须清晰地说明:
- 任务:评审要评测什么(例如「评测问题与答案之间的相关性」)
- 标准:详细解释该标准的含义(例如「相关性指答案依据标准答案、以充分的信息回应了问题」)
- 打分体系:根据评审模型擅长的形式来选择:
- 分类(好/坏、相关/不相关)——最可靠
- 离散数值(1—5)——效果良好;避免过宽的取值区间
- 连续值(0—1)——最不可靠;尽量优先用离散值
- 示例:给出带评分的示例。Zheng et al. (2023) 表明,这能把 GPT-4 的一致性从 65% 提升到 77.5%。
关键原则:AI 评审更擅长文本分类,而非数值打分。离散量表(1—5)优于连续量表。量表越宽,难度越大。
常见的内置标准
| 工具 | 内置标准 |
|---|---|
| Azure AI Studio | 接地性、相关性、连贯性、流畅度、相似度 |
| MLflow | 忠实度、相关性 |
| LangChain Criteria | 简洁性、相关性、正确性、连贯性、有害性、有用性、争议性 |
| RAGAS | 忠实度、答案相关性 |
警告:各工具之间的标准并不统一。MLflow 中的「忠实度」(1—5 量表)不同于 RAGAS(0 或 1)和 LlamaIndex(YES/NO)。在确认提示词与量表一致之前,切勿跨工具比较分数。
局限
不一致性
AI 评审是概率性的。同一个评审对同一份输入运行两次,可能输出不同的分数。这会削弱可复现性和可信度。缓解办法:使用更低的 temperature、加入少样本(few-shot)示例、运行多次并做聚合。
自我偏好(位置偏好与长度偏好)
AI 评审往往会: - 偏好自己的输出:在评判与另一个模型回答的对比时倾向于自家输出 - 偏爱更长的回答:即便更短的回答更准确(GPT-4 已被证明存在这一倾向,PALM-2 亦然;Saito et al., 2023) - 偏好处于第一位的回答:在成对对比中如此
缓解办法:交换回答顺序并对分数取平均;在提示词中显式惩罚长度;使用来自不同模型家族的评审。
标准的模糊性
在缺乏标准化标准的情况下,同一个标准名称在不同工具中可能衡量的是不同的东西。在比较评测结果之前,务必检视底层的评审提示词。
成本与延迟
AI 充当评审会为每次评测至少增加一次额外的模型调用。对于高吞吐量的生产系统,这会显著成倍放大推理成本。缓解办法:只评测一个采样(例如 1—5%),而非全部流量;常规检查用更便宜的评审,回归测试用更强的评审。
天花板问题
对于现有最强的模型,没有比它本身更强、合格的评审可用。比较类方法(Chatbot Arena)通过大规模聚合人类偏好,在一定程度上缓解了这一问题。
哪些模型可以充当评审?
三种配置:
| 评审强度(相对被评模型) | 应用场景 | 优劣 |
|---|---|---|
| 更强的评审 | 主要的生产评测 | 准确性更好;成本更高;最强模型没有合格的评审 |
| 同等强度的评审 | 交叉验证 | 可行;需警惕模型家族偏好 |
| 自评测(自我批判) | 健全性检查;回答修订 | 快;易受自我偏好影响;适合触发重新生成 |
| 专用的弱评审 | 高吞吐量的常规检查 | 成本低;针对特定标准训练;可能漏掉通用质量问题 |
推荐做法:离线评测和回归测试用更强的模型。生产环境采样用同等强度或专用评审。部署前,所有评审都应在一个有代表性的留出(hold-out)集上,与人工标注进行验证。
比较式评测与模型排名
比较式评测——让评测者(人类或 AI)从两个回答中挑出更好的一个——会产出成对偏好数据。Elo 风格的排名(如 LMSYS Chatbot Arena 所采用)将成对结果聚合为一个稳定的排行榜。
何时使用比较式评测: - 主观的质量评判(风格、有用性、语气) - 在多个模型或提示词变体之间做选择 - 采集 RLHF 偏好训练数据
何时不要使用比较式评测: - 有客观正确答案的事实性问题——偏好投票可能产生错误信号 - 对话式 UX 场景——要求用户做选择会带来摩擦
最佳实践
| 挑战 | 建议 |
|---|---|
| 分数不一致 | 降低 temperature;加入少样本示例;多次运行并取平均 |
| 位置/长度偏好 | 随机化回答顺序;交换并取平均;在提示词中惩罚长度 |
| 跨工具的标准漂移 | 锁定评审提示词与模型版本;将两者一并存入受版本管理的评测配置 |
| 评测成本 | 生产环境采样 1—5%;常规信号用更便宜的专用评审 |
| 生产环境无标准答案 | 用 AI 评审 + 隐式信号(点击、追问)作为互补信号 |
| 评审验证 | 在信任评审之前,务必在留出集上将评审分数与人工标注做相关性核对 |