评测技术雷达
概述
本页汇总 LLM 与智能体评测工具,涵盖开源框架/工具包和托管式企业平台,并参考 Thoughtworks Technology Radar 方法将其映射到一张技术雷达。分类方式与智能体开发框架雷达和智能体可观测性雷达保持一致,旨在为实际选型提供辅助:条件允许时优先从 Adopt(采用)项开始;针对特定目标试点 Trial(试用)项;将 Assess(评估)项纳入观察清单;仅在有明确理由时使用 Hold(暂缓)项。
雷达包含四个环:
| 环 | 含义 |
|---|---|
| Adopt(采用) | 已得到验证并被广泛使用。适配现有技术栈时,建议作为默认起点。 |
| Trial(试用) | 值得在能够承担一定风险或集成工作的项目中试点。 |
| Assess(评估) | 前景可期,但仍需结合自身生产约束进一步验证。 |
| Hold(暂缓) | 不建议作为默认选择;仅在理由充分时使用,例如企业已有统一标准。 |
技术雷达
为避免标签拥挤,解决方案拆分为两张图。两图采用相同的 x 轴(环位置:Hold/Assess → Trial/Adopt),但 y 轴不同。
阅读方式: - 右侧(x > 0.5)= Trial/Adopt——生产成熟度较高,更适合作为默认候选 - 左侧(x < 0.5)= Assess/Hold——适用范围有限、偏小众或验证尚不充分
图 1——开源评测框架与工具包
Y 轴:RAG/智能体专项(下)→ 通用 LLM 评测(上)
quadrantChart
title Open Source Evaluation Frameworks — Jul 2026
x-axis Hold/Assess --> Trial/Adopt
y-axis RAG/Agent-Specialized --> General-Purpose LLM Eval
quadrant-1 General - Production Ready
quadrant-2 General - Emerging
quadrant-3 Specialized - Emerging
quadrant-4 Specialized - Production Ready
AgentPex: [0.38, 0.15]
AWS Agent-EvalKit: [0.35, 0.30]
Google LLM EvalKit: [0.32, 0.68]
Harbor: [0.58, 0.20]
LangChain OpenEvals: [0.62, 0.55]
Langfuse: [0.68, 0.60]
RAGAS: [0.82, 0.22]
DeepEval: [0.86, 0.68]
MLFlow LLM Evaluate: [0.80, 0.78]
图 2——托管式与企业级评测平台
Y 轴:云/厂商专属(下)→ 云/厂商无关(上)
quadrantChart
title Managed / Enterprise Evaluation Platforms — Jul 2026
x-axis Hold/Assess --> Trial/Adopt
y-axis Vendor-Specific --> Vendor-Agnostic
quadrant-1 Agnostic - Production Ready
quadrant-2 Agnostic - Emerging
quadrant-3 Vendor-Specific - Emerging
quadrant-4 Vendor-Specific - Production Ready
LastMile AI: [0.42, 0.70]
Google Stax: [0.55, 0.28]
LangSmith: [0.62, 0.65]
Braintrust: [0.60, 0.75]
Azure AI Foundry Evaluation: [0.80, 0.22]
AWS Bedrock Evaluations: [0.78, 0.18]
Galileo: [0.84, 0.80]
环级别说明(为何这样定位)
Adopt(采用)
| 项目 | 定位理由(简述) | 适用场景 |
|---|---|---|
| DeepEval | 采用最广泛的开源 LLM 评测框架;提供 14+ 项指标,并原生支持基于 pytest 的 CI/CD 集成。 | Python 代码库中开展 RAG/微调评测的默认选择。 |
| RAGAS | 专为 RAG 构建且被广泛引用的指标集,提供 8+ 项 RAG 指标和 3 项智能体工作流指标。 | 主要评测目标是 RAG 或智能体目标达成率/工具调用准确率时。 |
| MLFlow LLM Evaluate | 依托成熟且广泛采用的 MLFlow 生态;通过 MLFlow 的模型抽象支持任意 LLM 提供商。 | 已统一使用 MLFlow 进行实验追踪的团队。 |
| Galileo | 成熟的企业评测平台,提供预构建和自定义指标,以及由 CLHF 驱动的 Autotune。 | 需要厂商无关、生产级评测和人工反馈回路的企业团队。 |
| AWS Bedrock Evaluations | RAG 与 LLM 充当评审能力自 2025 年 3 月起 GA;在一项托管服务中整合模型比较、RAG 评测、LLM 充当评审及人工审核。 | 已使用 Amazon Bedrock,且希望避免单独搭建评测平台的团队。 |
| Azure AI Foundry Evaluation | 成熟的 GA 评测器套件,覆盖质量、NLP 与风险/安全指标,并直接集成 Observability 仪表板。 | 需要内置风险/安全护栏评测,并将结果接入生产可观测性的 Azure AI Foundry 团队。 |
Trial(试用)
| 项目 | 定位理由(简述) | 适用场景 |
|---|---|---|
| LangChain OpenEvals | 针对简洁性、公平性、幻觉等常见标准提供预构建的 LLM 充当评审提示词;成熟度低于 DeepEval/RAGAS。 | 使用 LangChain/LangSmith,并希望快速获得预构建评审器的团队。 |
| Langfuse | 同时提供开源与托管版本的 LLM/智能体可观测性平台,内置评测评分流水线;v3 架构基于 ClickHouse+Redis+S3。(与可观测性雷达中的 Trial 定位一致。) | 希望结合 AI 原生链路追踪与评测,同时保留开源控制权时。 |
| Harbor | Terminal-Bench 2.0/2.1 官方运行框架;擅长分布式智能体基准执行,但作为通用指标库的成熟度较低。 | 需要跨云沙箱提供商大规模运行智能体基准的团队。 |
| LangSmith | 链路追踪与评测体验出色;更适合已使用 LangChain/LangGraph 的团队,而非完全厂商无关的默认选择。 | 智能体技术栈以 LangChain/LangGraph 为主时。 |
| Braintrust | 评测优先的平台,支持针对生产基线检测回归,并将评测集成到提示词实验场;由于评测是其核心重点,本雷达定位比可观测性雷达中的 Assess 高一级。 | 需要通过回归门禁快速迭代生产 AI 系统的团队。 |
| Google Stax | 提供托管数据集和自定义评测器的 LLM 评测 SaaS;与 Google Cloud 紧密耦合。 | 使用 Google Cloud / Vertex AI 基础设施的团队。 |
Assess(评估)
| 项目 | 定位理由(简述) | 适用场景 |
|---|---|---|
| AgentPex | 基于系统提示词/工具模式生成评测规范的方法较新颖,但产品较新,且范围仅限于基于轨迹的智能体评测。 | 与现有 Langfuse/Langtrace 流水线集成,开展事后智能体轨迹评测。 |
| AWS Agent-EvalKit | 新推出的 Apache-2.0 六阶段工作流工具包;主要面向编码智能体 CLI(Claude Code、Kiro CLI、Kilo Code),而非通用 LLM 评测。 | 已在编码智能体 CLI 中工作,希望使用轻量级、代码优先评测工具包的团队。 |
| Google LLM EvalKit | 基于 Vertex AI 的新开源无代码提示词工程/评测中心;前景可期,但相较 Stax 或 DeepEval,规模化能力尚未充分验证。 | 希望获得可自托管、无代码提示词评测前端的 Google Cloud 团队。 |
| LastMile AI | 企业级评测工具,但公开采用信号弱于 Galileo、LangSmith 或 Braintrust。 | 已将 LastMile 纳入平台对比选型的企业团队。 |
Hold(暂缓)
目前没有项目被列入此环——这里评测的每款工具都至少有一个合理的生产应用场景。随着评测工具市场整合,应定期重新审视。
雷达汇总表
| 项目 | 环 | 类别 | 开源 | 备注 |
|---|---|---|---|---|
| DeepEval | Adopt | LLM 评测框架 | ✅ | 14+ 项指标,原生支持 pytest |
| RAGAS | Adopt | RAG/智能体评测框架 | ✅ | 8+ 项 RAG 指标,3 项智能体指标 |
| MLFlow LLM Evaluate | Adopt | LLM 评测框架 | ✅ | 集成到 MLFlow 生态 |
| Galileo | Adopt | 企业评测平台 | ❌ | CLHF + Autotune |
| AWS Bedrock Evaluations | Adopt | 托管式云评测服务 | ❌ | 2025 年 3 月 GA;LLM 充当评审 + RAG + 人工评测 |
| Azure AI Foundry Evaluation | Adopt | 托管式云评测服务 | ❌ | 质量 + NLP + 风险/安全评测器 |
| LangChain OpenEvals | Trial | LLM 充当评审提示词 | ✅ | 预构建标准评测器 |
| Langfuse | Trial | LLM/智能体可观测性 + 评测 | ✅ | 开源 + 托管 |
| Harbor | Trial | 智能体基准运行框架 | ✅ | Terminal-Bench 2.0/2.1 官方运行框架 |
| LangSmith | Trial | LLM/智能体评测 + 可观测性 | ❌ | 最适合 LangChain/LangGraph |
| Braintrust | Trial | 评测平台 | ❌ | 聚焦回归检测 |
| Google Stax | Trial | 托管式评测 SaaS | ❌ | 集成 GCP/Vertex AI |
| AgentPex | Assess | 智能体轨迹评测 | ✅ | 基于规范生成评测标准 |
| AWS Agent-EvalKit | Assess | 编码智能体评测工具包 | ✅ | 六阶段工作流 |
| Google LLM EvalKit | Assess | 无代码提示词评测中心 | ✅ | Vertex AI SDK |
| LastMile AI | Assess | 企业评测平台 | ❌ | 采用信号较弱 |
最佳实践
| 挑战 / 领域 | 说明 | 解决方案 / 建议 |
|---|---|---|
| 选择框架还是平台 | 开源框架(DeepEval、RAGAS)提供代码级控制;托管平台(Galileo、Bedrock Evaluations、Foundry Evaluation)则可降低运维开销。 | 如果已有 CI/CD 和数据集基础设施,从框架开始;如果希望开箱即用地获得数据集管理、仪表板和人工审核,选择托管平台。 |
| 避免云厂商锁定 | AWS Bedrock Evaluations 和 Azure AI Foundry Evaluation 均与各自云平台深度集成,适用范围也受其限制。 | 如果多云可移植性很重要,优先选择厂商无关方案(Galileo、LangSmith、Braintrust、DeepEval、RAGAS),或将评测逻辑与云原生服务解耦。 |
| 风险/安全指标与质量指标 | 并非所有工具都能同时覆盖负责任 AI 维度(危害性、越狱、受保护材料)与质量指标。 | 使用 Azure AI Foundry 的风险与安全评测器或 Bedrock 的负责任 AI 指标作为基础安全门禁,再叠加 RAGAS、DeepEval 等质量型框架。 |
| 较新/范围较窄的工具 | 多款 2026 年前后推出的工具(AgentPex、AWS Agent-EvalKit、Google LLM EvalKit)前景可期,但分别面向轨迹评测、编码 CLI 和无代码提示词评测等特定工作流。 | 针对其专长场景开展试点,不要直接作为通用评测底座;待其成熟后重新评估。 |
参见
- LLM 评测框架
- AI 充当评审——深入解析
- 智能体评测平台
- 智能体开发框架技术雷达
- 智能体可观测性技术雷达
- 基准测试
- AWS——智能体 AI 概述
- Google——智能体 AI 概述
- Microsoft——智能体 AI 概述
- 生产环境最佳实践——测试与评测
参考资料
- Thoughtworks Technology Radar —— 雷达方法论参考
- Amazon Bedrock Evaluations —— Bedrock 模型比较、RAG 与人工评测能力的产品页面
- Amazon Bedrock Model Evaluation LLM-as-a-judge is now generally available (AWS What's New) —— 2025 年 3 月 GA 公告
- Evaluate Generative AI Models and Apps with Microsoft Foundry —— 介绍三类评测指标及评测工作流
- Risk and Safety Evaluators for Generative AI (Microsoft Foundry) —— 风险/安全评测器分类详解
- Confident AI DeepEval —— 开源 LLM 评测框架
- RAGAS —— RAG 与智能体评测指标
- MLFlow LLM Evaluate —— MLFlow 的评测模块