跳转至

智能体 AI 评测

本章节全面覆盖用于评估智能体 AI 系统性能与能力的评测框架、基准测试与平台。从 LLM 评测框架到专项智能体基准测试,这里汇集了衡量、验证并持续改进 AI 智能体在各类领域和应用场景中表现所需的工具与方法论。

概述

评测智能体 AI 系统需要专门的方法,传统机器学习指标已无法满足需求。本章节涵盖以下内容:

  • LLM 评测框架:评估大语言模型的工具与方法论
  • 智能体评测基准:专为测试 AI 智能体能力而设计的基准测试
  • LLM 评测基准:社区驱动的排行榜与对比平台
  • 智能体评测平台:面向企业级综合 AI 评测的平台
  • 评测参考框架:研究性框架与方法论
  • 参考文档:来自行业领导者的最佳实践与指南

LLM 评测框架

开源框架

  • Confident AI DeepEval:开源 LLM 评测框架,提供 14 种以上的 LLM 评测指标,涵盖 RAG 和微调场景,为生产环境 AI 系统提供全面的评测能力。

  • MLFlow LLM Evaluate:模块化、轻量级的评测包,可集成到自定义评测流水线中运行,支持 RAG 评测和问答评测,并与现有机器学习工作流无缝集成。

  • RAGAS:专为评测 RAG 系统(提供 8 种以上指标)和智能体工作流(提供 3 项指标)而设计的评测工具,可对检索增强生成系统和智能体应用进行自动化评测。

  • LangChain OpenEvals:基于 LLM 充当评审方法论,内置用于评估 AI 回复简洁性、公平性和幻觉检测的预置提示词。

智能体评测基准

专项智能体基准

  • METR:(读作"meter")METR 是一家由捐款资助的研究机构,专注于研究、开发和运行对前沿 AI 系统在无人工干预情况下完成复杂任务能力的评测,重点关注自主能力评估。

  • Terminal Bench:专为在终端环境中运行的 AI 智能体设计的综合基准测试,评估命令行交互能力和系统管理任务。

  • VisualWebArena:面向多模态智能体的专项基准测试,测试智能体利用视觉与文本信息与 Web 界面交互的能力。

  • GAIA: HF Benchmarking General AI Agents:Hugging Face 推出的综合基准测试,用于评估通用 AI 智能体在多样化任务和领域中的表现。

  • OSWorld Benchmark for Multimodal Agents:在真实计算机环境中对多模态智能体执行开放式任务的基准测试,评估智能体与操作系统及应用程序交互的能力。

LLM 评测基准

社区驱动排行榜

面向开发的基准测试

  • SWE-Bench:测试系统自动解决 GitHub Issue 能力的数据集,是评测代码生成和软件开发智能体的核心工具。

智能体评测平台

企业级平台

  • Galileo:定制化平台,提供预置评测指标、自定义指标,以及基于 CLHF(持续人类反馈学习)持续改进评测器的 Autotune 功能。

  • Google's Stax:Google 提供的 LLM 评测 SaaS 解决方案,主要功能包括:

  • 托管测试数据集
  • 预置及自定义评测器
  • AI 聚合性能的可视化追踪

  • LastMile AI:企业级评测平台,为开发者提供在生产环境中测试、评测和基准评估 AI 应用所需的核心工具。

红队演练 / 对抗性测试

与能力基准测试不同,本类别评估智能体抵御蓄意对抗攻击的能力,涵盖提示词注入、工具调用劫持、记忆投毒和多智能体利用等攻击手段。完整的 12 类测试分类法与方法论,请参阅智能体 AI 红队演练指南(CSA)

  • AgentDojo:针对 LLM 智能体提示词注入攻击与防御的动态评测框架,包含 97 个真实任务和 629 个安全测试用例,衡量实用性保留率与攻击成功率。
  • Agent-SafetyBench:涵盖 8 个风险类别的 349 个交互式环境和 2,000 个测试用例,配备自动评分模型(准确率 91.5%),可评测 16 种以上 LLM 智能体。
  • Agent Security Bench (ASB):ICLR 2025 基准测试,在 10 个场景中评估 27 种攻防方法,对 13 个 LLM 进行基准评测(最高攻击成功率 84.3%),并引入实用性-安全性平衡指标。
  • SplxAI Agentic Radar:LLM 智能体工作流安全扫描器,提供工作流可视化、工具识别和漏洞映射报告。
  • Promptfoo LLM Security DB:针对 LLM 和智能体 AI 安全漏洞的结构化知识库。
  • AI Red Teaming Agent (Azure AI Foundry):Microsoft 提供的自动化内容安全扫描与攻击成功率(ASR)评测工具,集成于 Azure AI Foundry。

评测参考框架

研究性框架

  • Meta - MLGym:用于推进 AI 研究型智能体发展的框架与基准测试,GitHub 仓库提供实现细节和基准测试工具。

参考文档

行业最佳实践

  • RELEVANCE:Microsoft 推出的生成式 AI 评测框架,为 LLM 回复的自动化评测提供全面的方法论。

  • Cohere: Evaluating LLM Outputs:全面介绍在生产环境中评测大语言模型输出的最佳实践指南。

快速开始

面向开发者

  1. DeepEvalMLFlow 入手,进行基础 LLM 评测
  2. 使用 RAGAS 评测 RAG 系统
  3. 引入 SWE-Bench 评测代码生成能力

面向企业

  1. 考虑采用 GalileoLastMile AI 作为综合评测平台
  2. 使用 Google Stax 支持 Google Cloud 集成工作流
  3. 引入 METR 基准测试评估自主能力

面向研究者

  1. 探索 MLGym 进行以研究为导向的评测
  2. 参与 LMSYS Chatbot Arena 贡献社区评测数据
  3. 使用 OSWorld 开展多模态智能体研究

最佳实践

  • 多指标评测:结合多个评测框架,获取全面洞察
  • 领域专项基准:选择与具体应用场景契合的基准测试
  • 持续评测:在生产环境中实施持续评测机制
  • 人在回路(HITL):对于关键应用,将自动化指标与人工评测结合使用
  • 基线对比:始终与已建立的基线及历史版本进行比较

这套评测生态系统为构建可靠、可量化、持续改进的智能体 AI 系统奠定了基础。

参见