智能体可观测性技术雷达
概述
本页汇总了智能体 / LLM 可观测性工具、相关标准及邻近的 APM 平台,并将它们映射到一张参考 Thoughtworks 技术雷达 方法论改编而来的技术雷达。本页的目标是提供实用的工具选型参考:条件允许时优先选择 Adopt(采纳) 环中的工具,将 Trial(试用) 环的工具用于定向试点,把 Assess(评估) 环的工具纳入关注列表,对 Hold(暂缓) 环中的工具则避免将其作为默认选项。
四个雷达环说明如下:
| 环 | 含义 |
|---|---|
| Adopt(采纳) | 已经过验证、广泛使用,在技术栈匹配的前提下推荐作为默认起点。 |
| Trial(试用) | 适合在能够承受一定风险或集成工作量的项目中试点。 |
| Assess(评估) | 前景可期,但仍需针对生产环境约束进行验证。 |
| Hold(暂缓) | 避免作为默认选择;仅在有明确理由时使用(例如已有企业级标准化)。 |
技术雷达
图表分为两张,以避免标签拥挤。两张图共享相同的 x 轴(环位置:Hold/Assess → Trial/Adopt),y 轴则各有侧重。
如何阅读: - 右侧(x > 0.5)= Trial/Adopt — 已具备生产就绪能力,是更强的默认候选 - 左侧(x < 0.5)= Assess/Hold — 场景受限、较为小众,或尚未针对智能体工作负载充分验证
图表一 — 开源与可自托管工具
Y 轴:智能体专用(下)→ 通用可观测性(上)
quadrantChart
title 开源 / 自托管可观测性 — 2026 年 5 月
x-axis 暂缓/评估 --> 试用/采纳
y-axis 智能体专用 --> 通用可观测性
quadrant-1 通用 - 生产就绪
quadrant-2 通用 - 新兴
quadrant-3 智能体原生 - 新兴
quadrant-4 智能体原生 - 生产就绪
agenttrace: [0.42, 0.18]
Openlit: [0.62, 0.28]
Langfuse: [0.80, 0.35]
Zipkin: [0.65, 0.55]
ClickStack: [0.58, 0.65]
SigNoz: [0.74, 0.72]
Jaeger: [0.76, 0.82]
Prometheus + Grafana: [0.88, 0.88]
OpenTelemetry: [0.92, 0.72]
图表二 — 托管与专有平台
Y 轴:AI / 智能体原生(下)→ 通用 APM(上)
quadrantChart
title 托管 / 专有可观测性 — 2026 年 5 月
x-axis 暂缓/评估 --> 试用/采纳
y-axis AI 智能体原生 --> 通用 APM
quadrant-1 通用 APM - 生产可用
quadrant-2 通用 APM - 新兴
quadrant-3 AI 原生 - 新兴
quadrant-4 AI 原生 - 生产可用
AgentOps: [0.72, 0.18]
Galileo: [0.64, 0.28]
W&B Weave: [0.68, 0.40]
Braintrust: [0.62, 0.52]
Comet Opik: [0.56, 0.60]
LangSmith: [0.84, 0.30]
Dynatrace: [0.70, 0.70]
New Relic: [0.76, 0.80]
Datadog: [0.86, 0.88]
环位说明(入选理由)
Adopt(采纳)
| 工具 | 入选理由(简) | 适用场景 |
|---|---|---|
| OpenTelemetry | 厂商中立的链路追踪 / 指标 / 日志标准,支持与主流后端互操作。 | 需要可移植埋点、保留切换厂商灵活性时。 |
| Prometheus + Grafana | 被广泛采用的开源指标与可视化组合,可与 OpenTelemetry 流水线良好集成。 | 需要为智能体系统构建基础设施与应用指标基线时。 |
| Datadog | 常见的企业级 APM 基线,用于统一应用与基础设施监控(通常包含 AI 插件)。 | 组织已将 Datadog 作为标准,并希望在单一视图中统一管理时。 |
Trial(试用)
| 工具 | 入选理由(简) | 适用场景 |
|---|---|---|
| Langfuse | 开源 LLM / 智能体可观测性平台,涵盖链路追踪、评测与提示词管理,支持自托管与云端两种模式。v3 架构基于 ClickHouse + Redis + S3,SDK 原生支持 OpenTelemetry。 | 需要 AI 原生可见性且偏好开源管控时。 |
| SigNoz | 开源、OTel 原生的全栈可观测性平台(日志 + 指标 + 链路追踪),后端基于 ClickHouse,支持 PromQL 与 ClickHouse SQL,是 Datadog 的低成本自托管替代方案。 | 需要覆盖基础设施与 AI 工作负载、同时避免厂商锁定的开源可观测性方案时。 |
| LangSmith | 链路追踪体验出色,评测工作流完善,最适合已使用 LangChain / LangGraph 的团队。 | 智能体技术栈以 LangChain / LangGraph 为主时。 |
| AgentOps | 面向智能体的监控与成本分析平台,通常为专有产品。 | 需要快速获得智能体原生看板、不想自建监控栈时。 |
| Galileo | 智能体可靠性平台,提供多智能体链路追踪与图形视图。 | 需要多智能体工作流调试与可靠性分析时。 |
| W&B Weave | 在实验追踪与迭代式提示词 / 模型对比方面表现突出。 | 团队已在实验中使用 W&B 工作流,并希望将可见性延伸至生产环境时。 |
Assess(评估)
| 工具 | 入选理由(简) | 适用场景 |
|---|---|---|
| Openlit | 开源、OTel 原生的"AI 工程"平台,涵盖可观测性及相关工作流。 | 需要 OTel 原生 AI 可观测性但需验证功能深度是否满足具体需求时。 |
| Jaeger / Zipkin | 成熟的开源链路追踪后端,采用情况因组织和现有 OTel 流水线选型而异。 | 希望在不引入商业套件的前提下获得开源链路追踪能力时。 |
| Braintrust | 面向生产环境的迭代与回归检测,但适配度取决于工作流成熟度。 | 准备将真实流量的持续评测纳入运营体系时。 |
| Comet Opik | 在成熟的 ML 追踪基础上扩展至 LLM / 智能体工作负载,需验证工作流与集成的匹配度。 | 组织已使用 Comet 并希望在 ML 与 LLM 之间保持一致性时。 |
| New Relic / Dynatrace | 常见的企业级 APM 标准选型,需验证 AI / 智能体埋点的深度以及链路追踪 / 评测的 UX。 | 在现有 APM 工具基础上叠加 AI 层时。 |
Hold(暂缓)
| 工具 | 入选理由(简) | 仍可能适用的场景 |
|---|---|---|
| agenttrace | 在本地优先的编程智能体链路报告方面表现出色,但并非通用的生产可观测性后端。 | 专门需要从本地编程智能体日志生成 CI 友好摘要时(开发者工作流)。 |
雷达汇总表
| 工具 | 环 | 类别 | 开源 | 说明 |
|---|---|---|---|---|
| OpenTelemetry | Adopt | 标准 / 埋点 | ✅ | 厂商中立的链路追踪 / 指标 / 日志 |
| Prometheus + Grafana | Adopt | 指标与可视化 | ✅ | 常见开源基线 |
| Datadog | Adopt | 企业级 APM | ❌ | 常作为组织级 APM 标准 |
| Langfuse | Trial | LLM / 智能体可观测性 | ✅ | 开源 + 托管。v3 使用 ClickHouse+Redis+S3;SDK 原生支持 OpenTelemetry。(Thoughtworks Vol.34:Trial) |
| SigNoz | Trial | 全栈可观测性 | ✅ | 开源、OTel 原生,ClickHouse 后端,Datadog 的自托管替代方案。(Thoughtworks Vol.34:Trial) |
| LangSmith | Trial | LLM / 智能体可观测性 | ❌ | 最适合 LangChain / LangGraph |
| AgentOps | Trial | 智能体可观测性 | ❌ | 智能体专用分析与成本管理 |
| Galileo | Trial | 智能体可靠性 | ❌ | 多智能体工作流链路视图 |
| W&B Weave | Trial | 实验 + 生产追踪 | ❌ | 强大的迭代工作流 |
| Openlit | Assess | OTel 原生 AI 工程 | ✅ | 需验证广度是否满足需求 |
| Jaeger | Assess | 链路追踪后端 | ✅ | 常见于开源链路追踪栈 |
| Zipkin | Assess | 链路追踪后端 | ✅ | 常见于开源链路追踪栈 |
| Braintrust | Assess | AI 可观测性 | ❌ | 面向迭代与回归检测 |
| Comet Opik | Assess | ML / LLM 可观测性 | ❌ | 已使用 Comet 时适合延续 |
| New Relic | Assess | 企业级 APM | ❌ | 常作为组织级 APM 标准 |
| Dynatrace | Assess | 企业级 APM | ❌ | 常作为组织级 APM 标准 |
| agenttrace | Hold | 本地链路报告 | ✅ | 最适合编程智能体日志 |
最佳实践
| 挑战 / 领域 | 描述 | 解决方案 / 建议 |
|---|---|---|
| 关联智能体步骤 | 调试多步骤推理与工具调用,需要在链路追踪 / 日志 / 指标之间保持一致的关联关系。 | 在 LLM 调用、工具调用、记忆操作和子智能体调用中统一使用关联 ID;尽可能采用 OpenTelemetry 上下文传播。 |
| 平衡成本与可见性 | 大规模场景下,全保真数据采集的成本可能很高。 | 对成功请求进行采样,对错误请求保持 100% 采集,并为定向排查保留高保真"调试模式"。 |
| 链路 / 日志中的隐私保护 | 提示词和工具输出往往包含敏感数据。 | 在持久化前实施 PII 检测与脱敏;对可观测性存储严格执行 RBAC。 |
| 将评测纳入可观测性 | 仅确认"系统在线"是不够的,质量与回归问题同样重要。 | 添加轻量级自动化评测(如接地性 / 相关性检测)并持续追踪趋势;在可行的情况下,以回归集作为发布门禁。 |
参见
参考资料
- Thoughtworks Technology Radar — 雷达方法论参考
- OpenTelemetry — 厂商中立的可观测性标准
- Langfuse — LLM 可观测性(开源 + 托管)
- Openlit — OpenTelemetry 原生 AI 工程平台
- LangSmith — LangChain / LangGraph 可观测性与评测
- AgentOps — 智能体可观测性平台
- Galileo — 智能体可靠性平台
- W&B Weave — LLM 应用追踪与评测框架
- Braintrust — AI 可观测性平台
- Comet Opik — ML / LLM 可观测性(Comet)
- agenttrace — 本地优先的编程智能体链路报告工具
- SigNoz — 开源 OpenTelemetry 原生可观测性平台
- Thoughtworks Technology Radar Vol. 34 — 2026 年 4 月;SigNoz(Trial)与 Langfuse(Trial)雷达定位的来源