LLM 评测框架
概述
LLM 评测框架提供程序化工具,用于衡量 LLM 输出的质量、准确性与安全性。这类框架支持在 CI/CD 工作流中持续运行自动化评测流水线,从而替代或辅助成本高昂的人工评测。
开源框架
DeepEval
目前应用最广泛的开源 LLM 评测框架,提供 14 个以上评测指标,覆盖 RAG 与微调两大应用场景,并与 pytest 深度集成,契合开发者的日常工作流。
核心指标: - 忠实度(Faithfulness):衡量响应是否以所提供的上下文为依据 - 答案相关性(Answer Relevancy):评估响应是否切实回答了问题 - 上下文精确率/召回率(Contextual Precision/Recall):评测 RAG 系统的检索质量 - 幻觉(Hallucination):检测事实性错误陈述 - 毒性(Toxicity):识别有害或不当内容 - 偏见(Bias):检测带有偏见的语言或推理 - G-Eval:基于 LLM 充当评审的自定义指标定义
应用场景:RAG 评测、微调验证、回归测试、CI/CD 集成
MLFlow LLM Evaluate
集成于 MLFlow 生态的模块化评测包,可以最小化配置在现有 ML 流水线中运行评测,支持 RAG 评测、问答评测及自定义指标定义。
核心特性: - 与 MLFlow 实验追踪无缝集成 - 内置问答与 RAG 场景指标 - 支持自定义 LLM 评审 - 跨模型版本与配置的对比分析 - 通过 MLFlow 的模型抽象层适配任意 LLM 提供商
RAGAS
资源:RAGAS
专为 RAG 系统与智能体工作流设计的评测框架,提供 8 个以上 RAG 评测指标,以及 3 个专用于智能体评测的指标。
RAG 指标: - 上下文精确率(Context Precision):已检索上下文中相关内容的占比 - 上下文召回率(Context Recall):相关信息被成功检索的占比 - 忠实度(Faithfulness):答案是否有上下文支撑 - 答案相关性(Answer Relevancy):答案是否回应了问题 - 上下文实体召回率(Context Entity Recall):关键实体相对于标准答案的覆盖程度
智能体指标: - 工具调用准确率(Tool Call Accuracy):工具选择与参数传递的正确性 - 智能体目标达成率(Agent Goal Accuracy):智能体是否实现了预定目标 - 话题遵从性(Topic Adherence):智能体是否保持在预定话题范围内
LangChain OpenEvals
基于 LLM 充当评审方法论,为常见评测场景提供预构建提示词,包含简洁性、公平性、幻觉检测及自定义标准等评测器。
核心特性: - 针对常见质量维度的预构建评测器 - 轻松与 LangSmith 集成以便追踪 - 支持自定义评测标准的扩展 - 兼容基于参考答案与无参考答案的评测模式
AgentPex(Microsoft)
Microsoft 开源的智能体系统评测工具,从执行轨迹对 AI 智能体进行评测。该工具支持导入多种格式的智能体轨迹,自动从系统提示词和工具 Schema 中提取规格说明,并基于 LLM 评测对智能体行为进行打分。采用 MIT 许可证。
核心特性:
- 8 种评测技术:规划生成、输出规格验证、参数检查、接地评估等
- 规格提取:自动从系统提示词和工具 Schema 推导评测标准,无需手动编写评分标准
- 多格式轨迹导入:支持标准 JSON、Tau-sq、Langfuse 及 Langtrace(OTEL spans)
- 多轮对话支持:端到端评测复杂的智能体对话
- 平台集成:将评测分数回推至 Langfuse 和 Langtrace 控制台,实现统一可观测性
- 可配置 LLM 评审:通过 DEFAULT_LLM 环境变量支持 OpenAI、Azure 及 Ollama 兼容端点
应用场景:事后智能体轨迹评测、基于规格推导标准的自动化回归测试、与现有 Langfuse/Langtrace 可观测性流水线集成
评测方法论
LLM 充当评审
使用能力较强的 LLM(如 GPT-4、Claude)对另一 LLM 的输出进行评测,评审模型依据提示词中定义的标准对响应打分。
优势:灵活、可评测主观质量、易于扩展 局限:成本较高、评审模型存在偏见、多次运行结果不一致
最佳实践: - 选用能力强于被评测模型的模型担任评审 - 定义清晰、具体的评测标准 - 使用结构化输出(评分 + 推理过程)以保证一致性 - 通过人工相关性研究验证评审的可靠性
基于参考答案的评测
将模型输出与标准答案进行比对,使用自动化指标衡量质量。
指标: - BLEU/ROUGE:N-gram 重叠率(主要用于摘要/翻译) - BERTScore:基于 BERT 嵌入的语义相似度 - 精确匹配(Exact Match):事实性问题的二值正确性判断 - F1 分数:抽取式问答的 Token 级重叠率
人工评测
质量评估的黄金标准,但成本高、耗时长。最适用于以下场景: - 验证自动化指标的可靠性 - 评测主观质量(创意、语气、有用性) - 最终生产环境就绪评估
评测流水线设计
持续评测
将评测集成到 CI/CD 流水线中,及时捕获回归问题:
# Example with DeepEval
from deepeval import evaluate
from deepeval.metrics import AnswerRelevancyMetric, FaithfulnessMetric
from deepeval.test_case import LLMTestCase
test_case = LLMTestCase(
input="What is the capital of France?",
actual_output=agent_response,
retrieval_context=retrieved_docs
)
evaluate([test_case], [AnswerRelevancyMetric(), FaithfulnessMetric()])
评测数据集管理
- 维护经人工审核的黄金数据集,用于回归测试
- 定期更新数据集以反映新的使用场景
- 将数据集版本与模型版本同步管理
- 纳入边界案例与对抗性样本
选型指南
| 应用场景 | 推荐框架 |
|---|---|
| RAG 系统评测 | RAGAS、DeepEval |
| 通用 LLM 质量评测 | DeepEval、LangChain OpenEvals |
| MLFlow 集成 | MLFlow LLM Evaluate |
| 智能体评测 | RAGAS(智能体指标)、DeepEval |
| 智能体轨迹评测 | AgentPex(基于系统提示词和工具 Schema 推导规格标准) |
| 自定义指标 | DeepEval(G-Eval)、LangChain OpenEvals |