跳转至

智能体可观测性技术雷达

概述

本页汇总了智能体 / LLM 可观测性工具、相关标准及邻近的 APM 平台,并将它们映射到一张参考 Thoughtworks 技术雷达 方法论改编而来的技术雷达。本页的目标是提供实用的工具选型参考:条件允许时优先选择 Adopt(采纳) 环中的工具,将 Trial(试用) 环的工具用于定向试点,把 Assess(评估) 环的工具纳入关注列表,对 Hold(暂缓) 环中的工具则避免将其作为默认选项。

四个雷达环说明如下:

含义
Adopt(采纳) 已经过验证、广泛使用,在技术栈匹配的前提下推荐作为默认起点。
Trial(试用) 适合在能够承受一定风险或集成工作量的项目中试点。
Assess(评估) 前景可期,但仍需针对生产环境约束进行验证。
Hold(暂缓) 避免作为默认选择;仅在有明确理由时使用(例如已有企业级标准化)。

技术雷达

图表分为两张,以避免标签拥挤。两张图共享相同的 x 轴(环位置:Hold/Assess → Trial/Adopt),y 轴则各有侧重。

如何阅读: - 右侧(x > 0.5)= Trial/Adopt — 已具备生产就绪能力,是更强的默认候选 - 左侧(x < 0.5)= Assess/Hold — 场景受限、较为小众,或尚未针对智能体工作负载充分验证

图表一 — 开源与可自托管工具

Y 轴:智能体专用(下)→ 通用可观测性(上)

quadrantChart title 开源 / 自托管可观测性 — 2026 年 5 月 x-axis 暂缓/评估 --> 试用/采纳 y-axis 智能体专用 --> 通用可观测性 quadrant-1 通用 - 生产就绪 quadrant-2 通用 - 新兴 quadrant-3 智能体原生 - 新兴 quadrant-4 智能体原生 - 生产就绪 agenttrace: [0.42, 0.18] Openlit: [0.62, 0.28] Langfuse: [0.80, 0.35] Zipkin: [0.65, 0.55] ClickStack: [0.58, 0.65] SigNoz: [0.74, 0.72] Jaeger: [0.76, 0.82] Prometheus + Grafana: [0.88, 0.88] OpenTelemetry: [0.92, 0.72]

图表二 — 托管与专有平台

Y 轴:AI / 智能体原生(下)→ 通用 APM(上)

quadrantChart title 托管 / 专有可观测性 — 2026 年 5 月 x-axis 暂缓/评估 --> 试用/采纳 y-axis AI 智能体原生 --> 通用 APM quadrant-1 通用 APM - 生产可用 quadrant-2 通用 APM - 新兴 quadrant-3 AI 原生 - 新兴 quadrant-4 AI 原生 - 生产可用 AgentOps: [0.72, 0.18] Galileo: [0.64, 0.28] W&B Weave: [0.68, 0.40] Braintrust: [0.62, 0.52] Comet Opik: [0.56, 0.60] LangSmith: [0.84, 0.30] Dynatrace: [0.70, 0.70] New Relic: [0.76, 0.80] Datadog: [0.86, 0.88]

环位说明(入选理由)

Adopt(采纳)

工具 入选理由(简) 适用场景
OpenTelemetry 厂商中立的链路追踪 / 指标 / 日志标准,支持与主流后端互操作。 需要可移植埋点、保留切换厂商灵活性时。
Prometheus + Grafana 被广泛采用的开源指标与可视化组合,可与 OpenTelemetry 流水线良好集成。 需要为智能体系统构建基础设施与应用指标基线时。
Datadog 常见的企业级 APM 基线,用于统一应用与基础设施监控(通常包含 AI 插件)。 组织已将 Datadog 作为标准,并希望在单一视图中统一管理时。

Trial(试用)

工具 入选理由(简) 适用场景
Langfuse 开源 LLM / 智能体可观测性平台,涵盖链路追踪、评测与提示词管理,支持自托管与云端两种模式。v3 架构基于 ClickHouse + Redis + S3,SDK 原生支持 OpenTelemetry。 需要 AI 原生可见性且偏好开源管控时。
SigNoz 开源、OTel 原生的全栈可观测性平台(日志 + 指标 + 链路追踪),后端基于 ClickHouse,支持 PromQL 与 ClickHouse SQL,是 Datadog 的低成本自托管替代方案。 需要覆盖基础设施与 AI 工作负载、同时避免厂商锁定的开源可观测性方案时。
LangSmith 链路追踪体验出色,评测工作流完善,最适合已使用 LangChain / LangGraph 的团队。 智能体技术栈以 LangChain / LangGraph 为主时。
AgentOps 面向智能体的监控与成本分析平台,通常为专有产品。 需要快速获得智能体原生看板、不想自建监控栈时。
Galileo 智能体可靠性平台,提供多智能体链路追踪与图形视图。 需要多智能体工作流调试与可靠性分析时。
W&B Weave 在实验追踪与迭代式提示词 / 模型对比方面表现突出。 团队已在实验中使用 W&B 工作流,并希望将可见性延伸至生产环境时。

Assess(评估)

工具 入选理由(简) 适用场景
Openlit 开源、OTel 原生的"AI 工程"平台,涵盖可观测性及相关工作流。 需要 OTel 原生 AI 可观测性但需验证功能深度是否满足具体需求时。
Jaeger / Zipkin 成熟的开源链路追踪后端,采用情况因组织和现有 OTel 流水线选型而异。 希望在不引入商业套件的前提下获得开源链路追踪能力时。
Braintrust 面向生产环境的迭代与回归检测,但适配度取决于工作流成熟度。 准备将真实流量的持续评测纳入运营体系时。
Comet Opik 在成熟的 ML 追踪基础上扩展至 LLM / 智能体工作负载,需验证工作流与集成的匹配度。 组织已使用 Comet 并希望在 ML 与 LLM 之间保持一致性时。
New Relic / Dynatrace 常见的企业级 APM 标准选型,需验证 AI / 智能体埋点的深度以及链路追踪 / 评测的 UX。 在现有 APM 工具基础上叠加 AI 层时。

Hold(暂缓)

工具 入选理由(简) 仍可能适用的场景
agenttrace 在本地优先的编程智能体链路报告方面表现出色,但并非通用的生产可观测性后端。 专门需要从本地编程智能体日志生成 CI 友好摘要时(开发者工作流)。

雷达汇总表

工具 类别 开源 说明
OpenTelemetry Adopt 标准 / 埋点 厂商中立的链路追踪 / 指标 / 日志
Prometheus + Grafana Adopt 指标与可视化 常见开源基线
Datadog Adopt 企业级 APM 常作为组织级 APM 标准
Langfuse Trial LLM / 智能体可观测性 开源 + 托管。v3 使用 ClickHouse+Redis+S3;SDK 原生支持 OpenTelemetry。(Thoughtworks Vol.34:Trial)
SigNoz Trial 全栈可观测性 开源、OTel 原生,ClickHouse 后端,Datadog 的自托管替代方案。(Thoughtworks Vol.34:Trial)
LangSmith Trial LLM / 智能体可观测性 最适合 LangChain / LangGraph
AgentOps Trial 智能体可观测性 智能体专用分析与成本管理
Galileo Trial 智能体可靠性 多智能体工作流链路视图
W&B Weave Trial 实验 + 生产追踪 强大的迭代工作流
Openlit Assess OTel 原生 AI 工程 需验证广度是否满足需求
Jaeger Assess 链路追踪后端 常见于开源链路追踪栈
Zipkin Assess 链路追踪后端 常见于开源链路追踪栈
Braintrust Assess AI 可观测性 面向迭代与回归检测
Comet Opik Assess ML / LLM 可观测性 已使用 Comet 时适合延续
New Relic Assess 企业级 APM 常作为组织级 APM 标准
Dynatrace Assess 企业级 APM 常作为组织级 APM 标准
agenttrace Hold 本地链路报告 最适合编程智能体日志

最佳实践

挑战 / 领域 描述 解决方案 / 建议
关联智能体步骤 调试多步骤推理与工具调用,需要在链路追踪 / 日志 / 指标之间保持一致的关联关系。 在 LLM 调用、工具调用、记忆操作和子智能体调用中统一使用关联 ID;尽可能采用 OpenTelemetry 上下文传播。
平衡成本与可见性 大规模场景下,全保真数据采集的成本可能很高。 对成功请求进行采样,对错误请求保持 100% 采集,并为定向排查保留高保真"调试模式"。
链路 / 日志中的隐私保护 提示词和工具输出往往包含敏感数据。 在持久化前实施 PII 检测与脱敏;对可观测性存储严格执行 RBAC。
将评测纳入可观测性 仅确认"系统在线"是不够的,质量与回归问题同样重要。 添加轻量级自动化评测(如接地性 / 相关性检测)并持续追踪趋势;在可行的情况下,以回归集作为发布门禁。

参见

参考资料