跳转至

评测技术雷达

概述

本页汇总 LLM 与智能体评测工具,涵盖开源框架/工具包和托管式企业平台,并参考 Thoughtworks Technology Radar 方法将其映射到一张技术雷达。分类方式与智能体开发框架雷达智能体可观测性雷达保持一致,旨在为实际选型提供辅助:条件允许时优先从 Adopt(采用)项开始;针对特定目标试点 Trial(试用)项;将 Assess(评估)项纳入观察清单;仅在有明确理由时使用 Hold(暂缓)项。

雷达包含四个环:

含义
Adopt(采用) 已得到验证并被广泛使用。适配现有技术栈时,建议作为默认起点。
Trial(试用) 值得在能够承担一定风险或集成工作的项目中试点。
Assess(评估) 前景可期,但仍需结合自身生产约束进一步验证。
Hold(暂缓) 不建议作为默认选择;仅在理由充分时使用,例如企业已有统一标准。

技术雷达

为避免标签拥挤,解决方案拆分为两张图。两图采用相同的 x 轴(环位置:Hold/Assess → Trial/Adopt),但 y 轴不同。

阅读方式: - 右侧(x > 0.5)= Trial/Adopt——生产成熟度较高,更适合作为默认候选 - 左侧(x < 0.5)= Assess/Hold——适用范围有限、偏小众或验证尚不充分

图 1——开源评测框架与工具包

Y 轴:RAG/智能体专项(下)→ 通用 LLM 评测(上)

quadrantChart title Open Source Evaluation Frameworks — Jul 2026 x-axis Hold/Assess --> Trial/Adopt y-axis RAG/Agent-Specialized --> General-Purpose LLM Eval quadrant-1 General - Production Ready quadrant-2 General - Emerging quadrant-3 Specialized - Emerging quadrant-4 Specialized - Production Ready AgentPex: [0.38, 0.15] AWS Agent-EvalKit: [0.35, 0.30] Google LLM EvalKit: [0.32, 0.68] Harbor: [0.58, 0.20] LangChain OpenEvals: [0.62, 0.55] Langfuse: [0.68, 0.60] RAGAS: [0.82, 0.22] DeepEval: [0.86, 0.68] MLFlow LLM Evaluate: [0.80, 0.78]

图 2——托管式与企业级评测平台

Y 轴:云/厂商专属(下)→ 云/厂商无关(上)

quadrantChart title Managed / Enterprise Evaluation Platforms — Jul 2026 x-axis Hold/Assess --> Trial/Adopt y-axis Vendor-Specific --> Vendor-Agnostic quadrant-1 Agnostic - Production Ready quadrant-2 Agnostic - Emerging quadrant-3 Vendor-Specific - Emerging quadrant-4 Vendor-Specific - Production Ready LastMile AI: [0.42, 0.70] Google Stax: [0.55, 0.28] LangSmith: [0.62, 0.65] Braintrust: [0.60, 0.75] Azure AI Foundry Evaluation: [0.80, 0.22] AWS Bedrock Evaluations: [0.78, 0.18] Galileo: [0.84, 0.80]

环级别说明(为何这样定位)

Adopt(采用)

项目 定位理由(简述) 适用场景
DeepEval 采用最广泛的开源 LLM 评测框架;提供 14+ 项指标,并原生支持基于 pytest 的 CI/CD 集成。 Python 代码库中开展 RAG/微调评测的默认选择。
RAGAS 专为 RAG 构建且被广泛引用的指标集,提供 8+ 项 RAG 指标和 3 项智能体工作流指标。 主要评测目标是 RAG 或智能体目标达成率/工具调用准确率时。
MLFlow LLM Evaluate 依托成熟且广泛采用的 MLFlow 生态;通过 MLFlow 的模型抽象支持任意 LLM 提供商。 已统一使用 MLFlow 进行实验追踪的团队。
Galileo 成熟的企业评测平台,提供预构建和自定义指标,以及由 CLHF 驱动的 Autotune。 需要厂商无关、生产级评测和人工反馈回路的企业团队。
AWS Bedrock Evaluations RAG 与 LLM 充当评审能力自 2025 年 3 月起 GA;在一项托管服务中整合模型比较、RAG 评测、LLM 充当评审及人工审核。 已使用 Amazon Bedrock,且希望避免单独搭建评测平台的团队。
Azure AI Foundry Evaluation 成熟的 GA 评测器套件,覆盖质量、NLP 与风险/安全指标,并直接集成 Observability 仪表板。 需要内置风险/安全护栏评测,并将结果接入生产可观测性的 Azure AI Foundry 团队。

Trial(试用)

项目 定位理由(简述) 适用场景
LangChain OpenEvals 针对简洁性、公平性、幻觉等常见标准提供预构建的 LLM 充当评审提示词;成熟度低于 DeepEval/RAGAS。 使用 LangChain/LangSmith,并希望快速获得预构建评审器的团队。
Langfuse 同时提供开源与托管版本的 LLM/智能体可观测性平台,内置评测评分流水线;v3 架构基于 ClickHouse+Redis+S3。(与可观测性雷达中的 Trial 定位一致。) 希望结合 AI 原生链路追踪与评测,同时保留开源控制权时。
Harbor Terminal-Bench 2.0/2.1 官方运行框架;擅长分布式智能体基准执行,但作为通用指标库的成熟度较低。 需要跨云沙箱提供商大规模运行智能体基准的团队。
LangSmith 链路追踪与评测体验出色;更适合已使用 LangChain/LangGraph 的团队,而非完全厂商无关的默认选择。 智能体技术栈以 LangChain/LangGraph 为主时。
Braintrust 评测优先的平台,支持针对生产基线检测回归,并将评测集成到提示词实验场;由于评测是其核心重点,本雷达定位比可观测性雷达中的 Assess 高一级。 需要通过回归门禁快速迭代生产 AI 系统的团队。
Google Stax 提供托管数据集和自定义评测器的 LLM 评测 SaaS;与 Google Cloud 紧密耦合。 使用 Google Cloud / Vertex AI 基础设施的团队。

Assess(评估)

项目 定位理由(简述) 适用场景
AgentPex 基于系统提示词/工具模式生成评测规范的方法较新颖,但产品较新,且范围仅限于基于轨迹的智能体评测。 与现有 Langfuse/Langtrace 流水线集成,开展事后智能体轨迹评测。
AWS Agent-EvalKit 新推出的 Apache-2.0 六阶段工作流工具包;主要面向编码智能体 CLI(Claude Code、Kiro CLI、Kilo Code),而非通用 LLM 评测。 已在编码智能体 CLI 中工作,希望使用轻量级、代码优先评测工具包的团队。
Google LLM EvalKit 基于 Vertex AI 的新开源无代码提示词工程/评测中心;前景可期,但相较 Stax 或 DeepEval,规模化能力尚未充分验证。 希望获得可自托管、无代码提示词评测前端的 Google Cloud 团队。
LastMile AI 企业级评测工具,但公开采用信号弱于 Galileo、LangSmith 或 Braintrust。 已将 LastMile 纳入平台对比选型的企业团队。

Hold(暂缓)

目前没有项目被列入此环——这里评测的每款工具都至少有一个合理的生产应用场景。随着评测工具市场整合,应定期重新审视。


雷达汇总表

项目 类别 开源 备注
DeepEval Adopt LLM 评测框架 14+ 项指标,原生支持 pytest
RAGAS Adopt RAG/智能体评测框架 8+ 项 RAG 指标,3 项智能体指标
MLFlow LLM Evaluate Adopt LLM 评测框架 集成到 MLFlow 生态
Galileo Adopt 企业评测平台 CLHF + Autotune
AWS Bedrock Evaluations Adopt 托管式云评测服务 2025 年 3 月 GA;LLM 充当评审 + RAG + 人工评测
Azure AI Foundry Evaluation Adopt 托管式云评测服务 质量 + NLP + 风险/安全评测器
LangChain OpenEvals Trial LLM 充当评审提示词 预构建标准评测器
Langfuse Trial LLM/智能体可观测性 + 评测 开源 + 托管
Harbor Trial 智能体基准运行框架 Terminal-Bench 2.0/2.1 官方运行框架
LangSmith Trial LLM/智能体评测 + 可观测性 最适合 LangChain/LangGraph
Braintrust Trial 评测平台 聚焦回归检测
Google Stax Trial 托管式评测 SaaS 集成 GCP/Vertex AI
AgentPex Assess 智能体轨迹评测 基于规范生成评测标准
AWS Agent-EvalKit Assess 编码智能体评测工具包 六阶段工作流
Google LLM EvalKit Assess 无代码提示词评测中心 Vertex AI SDK
LastMile AI Assess 企业评测平台 采用信号较弱

最佳实践

挑战 / 领域 说明 解决方案 / 建议
选择框架还是平台 开源框架(DeepEval、RAGAS)提供代码级控制;托管平台(Galileo、Bedrock Evaluations、Foundry Evaluation)则可降低运维开销。 如果已有 CI/CD 和数据集基础设施,从框架开始;如果希望开箱即用地获得数据集管理、仪表板和人工审核,选择托管平台。
避免云厂商锁定 AWS Bedrock Evaluations 和 Azure AI Foundry Evaluation 均与各自云平台深度集成,适用范围也受其限制。 如果多云可移植性很重要,优先选择厂商无关方案(Galileo、LangSmith、Braintrust、DeepEval、RAGAS),或将评测逻辑与云原生服务解耦。
风险/安全指标与质量指标 并非所有工具都能同时覆盖负责任 AI 维度(危害性、越狱、受保护材料)与质量指标。 使用 Azure AI Foundry 的风险与安全评测器或 Bedrock 的负责任 AI 指标作为基础安全门禁,再叠加 RAGAS、DeepEval 等质量型框架。
较新/范围较窄的工具 多款 2026 年前后推出的工具(AgentPex、AWS Agent-EvalKit、Google LLM EvalKit)前景可期,但分别面向轨迹评测、编码 CLI 和无代码提示词评测等特定工作流。 针对其专长场景开展试点,不要直接作为通用评测底座;待其成熟后重新评估。

参见

参考资料