跳转至

智能体评测平台

概述

智能体评测平台为测试、衡量和提升 AI 智能体在生产环境中的性能提供端到端基础设施。这类平台不仅限于简单的指标计算,还涵盖数据集管理、实验追踪、人工审核工作流以及持续监控等能力。

Gartner 市场定义:AI 评测与可观测性平台(AEOPs)

Gartner 将 AI 评测与可观测性平台(AI Evaluation and Observability Platforms,AEOPs) 定义为:帮助应对 AI 系统非确定性与不可预测性挑战的工具。AEOP 通过自动化评测("evals")来衡量 AI 输出是否达到性能、公平性、准确性等质量预期。这类工具把可观测性数据(日志、指标、链路追踪)回馈给评测,从而形成正向反馈闭环,提升系统的可靠性与对齐程度。AEOP 既可作为独立方案采购,也可作为更广义的 AI 应用开发平台的一部分。

AEOP 核心能力

Gartner 归纳出 AEOP 的八大标志性能力领域:

能力 说明
AI 系统可观测性 以不同粒度采集日志、指标与链路追踪——从多步骤的智能体工作流到单次请求-响应。涵盖可靠性度量(延迟、错误率)、可信度度量(可解释性、正确性、相关性、公平性)与成本度量(token 成本)。
评测运行自动化 用预定义数据集系统化地测试 AI 系统,并以自定义评分标准、借助多种评测器类型(基于代码的函数、人工判断或 LLM 充当评审)为输出打分。把评测作为质量门禁,阻止回归与不安全输出进入生产环境。
在线与离线评测 离线:在投产前用精选或外部数据集测试应用表现。在线:在生产环境中「实时」监控应用行为,以评估表现并即时采取行动。
提示词全生命周期管理 创建、参数化、版本化、测试并重放提示词。提示词参数化与版本化提升了跨实验的可复用性与可复现性。
沙箱环境 让技术与非技术干系人都能快速迭代提示词,试验不同模型与参数(如 temperature),并实时可视化对比输出。通过 API 密钥连接模型厂商 API——无需自行托管模型。
数据集管理与策展 大规模策展与管理评测数据集。数据集包含示例提示词,可附带上下文与预期输出。能力包括从零创建数据集、上传既有数据、管理版本,以及用标准答案进行标注。
自定义指标支持 支持 Ragas、G-Eval、GEMBA 等通用指标框架,量化主观度量(忠实度、连贯性、相关性、精确率),并支持创建针对安全与对齐目标定制的应用专属指标。
模型无关设计 支持跨各前沿厂商的多种商用与开源模型,避免厂商锁定,服务多样化的应用场景。

企业级评测平台

Galileo

资源Galileo

一款定制化评测平台,内置预构建评测指标、自定义指标及 Autotune 功能。Galileo 的 CLHF(基于人工反馈的持续学习)机制可根据人工纠错不断优化评测器。

核心特性: - 幻觉、毒性、PII 及相关性的预构建指标 - 无需编码即可创建自定义指标 - Autotune:利用人工反馈自动优化评测器 - 生产环境监控与实时告警 - 与主流 LLM 提供商及框架集成 - 提供 Agent Leaderboard 用于基准测试

适合场景:需要具备人工反馈回路的生产级评测的企业团队

Google Stax

资源Google Stax

Google 推出的 LLM 评测 SaaS 解决方案,提供托管测试数据集、预构建与自定义评测器,以及聚合 AI 性能的可视化追踪。

核心特性: - 托管测试数据集的创建与版本管理 - 面向常见质量维度的预构建评测器 - 自定义评测器创建 - 可视化性能追踪与趋势分析 - 与 Google Cloud 及 Vertex AI 集成

适合场景:使用 Google Cloud 基础设施和 Vertex AI 的团队

LastMile AI

资源LastMile AI

一款企业级评测平台,为开发者提供在生产环境中测试、评测和基准测试 AI 应用所需的核心工具。

核心特性: - 全面的测试与基准测试工具 - 生产环境监控与告警 - 面向团队协作评测的协同功能 - 与主流 LLM 框架集成

适合场景:需要全面生产评测能力的企业团队

AWS Bedrock Evaluations

资源Amazon Bedrock Evaluations

Amazon Bedrock 内置的全托管评测能力,可用于比较和选择基础模型,并评测基于 Bedrock Knowledge Bases 构建的 RAG 应用。它在一个工作流中整合自动指标、LLM 充当评审评分和人工审核;RAG 评测与 LLM 充当评审自 2025 年 3 月起正式可用。

核心特性: - LLM 充当评审:可从 Bedrock 提供的多个评审 LLM 中选择,依据预设的质量指标(正确性、完整性、专业风格/语气)和负责任 AI 指标(危害性、拒答情况)为响应评分,并为每项得分提供解释 - 自带推理结果:通过在输入提示词数据集中提供预生成响应,可评测任意模型或系统——无论其托管于 Bedrock 还是外部——无需强制通过 Bedrock 进行实时推理 - RAG 评测:自动评测基于 Bedrock Knowledge Bases 的 RAG 应用,包括引用覆盖率和引用精确率指标 - 人工评测:通过 Bedrock + SageMaker Ground Truth 构建自定义人工审核工作流,覆盖自动评审无法可靠衡量的标准

适合场景:已使用 Amazon Bedrock,并希望在无需单独搭建评测平台的情况下完成模型比较、RAG 质量评测和人工审核的团队

Azure AI Foundry Evaluation

资源Evaluate Generative AI Models and Apps with Microsoft Foundry

Microsoft Foundry 面向生成式 AI 模型、应用和智能体的原生评测服务。它覆盖三类指标,并与平台 Observability 仪表板集成,既支持生产前测试,也支持生产环境持续评测。

核心特性: - 三类指标:AI 辅助质量指标(由 LLM 评审整体质量/连贯性)、基于 NLP 的质量指标(与参考答案比较的文本相似度指标),以及风险与安全指标 - 风险与安全评测器:评测生成输出中的仇恨/不公平内容、色情内容、暴力内容、自残内容、直接/间接越狱漏洞及受保护材料 - 智能体评测:提供专门的智能体行为评测器,而不只评测单轮模型输出 - 可观测性集成:Foundry Observability 仪表板可实时呈现性能、安全和质量指标,并与评测结果统一展示 - 本地 + 云端评测:同时支持本地 Azure AI Evaluation SDK 和云端评测作业

适合场景:需要内置风险/安全护栏评测和质量指标,并将结果直接接入生产可观测性的 Azure AI Foundry 团队

开源与开发者平台

Harbor

资源harborframework.com | GitHub — harbor-framework/harbor

Harbor 是一个开源框架,出自 Terminal-Bench 的创建者之手,用于大规模评测与优化智能体和语言模型。它是 Terminal-Bench 2.0/2.1 的官方运行框架,对原始的 Terminal-Bench 运行框架进行了重构,以支持云部署容器、RL/SFT rollout 生成,以及一套厂商无关、可与任何能装进容器的智能体协作的接口。

核心特性: - 智能体评测:可运行任意智能体——Claude Code、OpenHands、Codex CLI、Mini-SWE-Agent,以及中立的 Terminus 2 测试床——对标准化基准进行评测 - 基准构建:让团队以 Harbor 任务格式构建并分享自定义基准与任务环境 - 分布式执行:通过可插拔的沙箱提供方,将实验扇出到数千个并行环境——Daytona、ModalLangSmith Sandboxes、Blaxel 与 Novita Sandbox - RL 优化:为强化学习与有监督微调流水线生成 rollout - Apache-2.0 许可;可通过 uv tool install harborpip 安装;主要为 Python(约 93%),并带一层 TypeScript CLI/UI - 截至 2026 年年中,3,000+ GitHub stars、1,300+ forks、23+ 个发行版

适合场景:需要跨云沙箱提供方大规模运行智能体基准(尤其是 Terminal-Bench),或从智能体轨迹生成 RL/SFT rollout 数据的团队与研究者

LangSmith

资源LangSmith

LangChain 的一体化开发与评测平台,将链路追踪、数据集管理和评测整合在单一平台中,与 LangChain 生态深度集成。

核心特性: - 针对 LangChain/LangGraph 应用的链路追踪与可视化 - 从生产链路创建数据集 - 基于自定义评测器的自动化评测 - 提示词版本管理与 A/B 测试 - 人工标注工作流 - CI/CD 集成,用于回归测试 - LangSmith Sandboxes(私有预览):用于运行不可信智能体代码的安全、microVM 隔离环境;每次评测试验都获得一个全新沙箱,试验间从不共享状态,从而支持数百个并行运行的横向扩展评测;被用作 Harbor 的可插拔执行提供方之一

适合场景:使用 LangChain/LangGraph 且希望链路追踪与评测一体化的团队

Braintrust

资源Braintrust

专注于生产环境 AI 性能衡量与提升的评测平台,擅长基于真实用户数据的回归检测及持续优化工作流。

核心特性: - 支持并排对比的实验追踪 - 针对生产基线的回归检测 - 人工审核与标注界面 - 集成评测能力的提示词实验场 - 支持编程式评测的 SDK

适合场景:需要快速迭代生产 AI 系统的团队

Langfuse

资源Langfuse

开源的 LLM 可观测性与评测平台,将链路追踪与评测能力整合在可自托管的软件包中。

核心特性: - 带评测评分的全量链路捕获 - 数据集管理与标注 - LLM 充当评审的评测流水线 - 开源版本,提供企业云选项 - Python 和 TypeScript 原生 SDK

适合场景:希望使用开源评测并具备自托管选项的团队

AWS Agent-EvalKit

资源AWS Machine Learning Blog — Evaluate AI agents systematically with Agent-EvalKit

一款 Apache-2.0 开源评测工具包(awslabs/Agent-EvalKit),围绕六阶段评测工作流构建,将基于代码的评测器与 LLM 充当评审的评测器相结合。该工具包设计上直接插入现有的编码智能体 CLI,无需独立的评测 UI。

核心特性: - 六阶段评测工作流(从测试用例定义到评分与报告) - 混合评测器模型:确定性的代码检查与 LLM 充当评审评分并行 - 与 Claude Code、Kiro CLI 和 Kilo Code 直接集成 - 开源(Apache-2.0),可自托管,无厂商锁定

适合场景:已在使用编码智能体 CLI 的团队,希望获得轻量级、代码优先的评测工具包,而非独立的托管平台

Google LLM EvalKit

资源Google Cloud Blog — Introducing LLM EvalKit | GitHub — GoogleCloudPlatform/generative-ai

一款基于 Vertex AI SDK 构建的轻量级开源应用,将提示词工程与评测集中到一个统一中心,用于替代分散在文档、电子表格和云控制台中、依赖主观感受的提示词迭代方式。

核心特性: - 为提示词创建、测试、版本管理与基准测试提供统一中心,使团队获得提示词历史和性能的记录系统 - 指标驱动的三步方法:定义问题、收集/创建具有代表性的测试数据集,再制定具体的客观指标来为输出评分 - 提供面向产品经理、UX 文案人员和其他非开发者的无代码 UI,同时兼顾技术工作流 - 与 Vertex AI Evaluation 和 Google Cloud 控制台评测界面集成 - GitHub 开源;除底层 Vertex AI 使用费外,无单独许可成本

适合场景:希望使用可自托管、无代码前端系统化开展提示词工程和评测,而不是采用 Google Stax 等全托管 SaaS 的 Google Cloud / Vertex AI 团队

研究评测框架

Meta MLGym

资源Meta MLGym

一个用于推进 AI 研究智能体发展的框架与基准测试,提供标准化环境,对智能体在机器学习研究任务上进行评测。GitHub 仓库 提供详细实现说明。

核心特性: - 标准化的 ML 研究任务环境 - 在真实 ML 问题上评测智能体(数据集分析、模型训练、超参数调优) - 可复现的基准测试方法论

评测平台对比

平台 开源 可自托管 人工审核 CI/CD 集成 智能体专项
Galileo
Google Stax
LastMile AI
Harbor 有限支持
LangSmith 有限支持
Braintrust
Langfuse
AWS Agent-EvalKit 有限支持
Google LLM EvalKit 有限支持
AWS Bedrock Evaluations 有限支持
Azure AI Foundry Evaluation

快速开始

面向开发者

  1. LangSmith(适用于 LangChain 用户)或 Langfuse(开源、框架无关)入手
  2. 从生产环境捕获链路,构建评测数据集
  3. 定义评测标准,实现自动化指标
  4. 在 CI/CD 流水线中配置回归测试

面向企业团队

  1. 评估 GalileoLastMile AI 以获取全面的企业级功能
  2. 与现有可观测性基础设施集成
  3. 针对高风险决策建立人工审核工作流
  4. 利用生产数据实施持续评测

面向研究团队

  1. 使用 Meta MLGym 进行研究智能体评测
  2. 结合 Langfuse 进行深度链路分析
  3. 采用标准化基准测试发布评测结果

最佳实践

  • 评测数据与训练数据严格分离:切勿将评测数据集用于训练
  • 结合自动化评测与人工评测:自动化指标保证规模,人工审核保证质量
  • 持续追踪评测结果:随着模型和提示词的变化,监控性能回归
  • 使用生产数据:从真实用户交互中构建评测数据集
  • 提前定义成功标准:在动手构建之前,明确"好"的定义

参见

参考资料