跳转至

可观测性解决方案

概述

AI 智能体与基于 LLM 的应用可观测性生态日趋完善,工具与平台种类繁多——从面向开发者、集成链路追踪的综合平台,到专注企业级监控的专业解决方案,不一而足。

集成可观测性的开发平台

AgentOps

平台AgentOps

专为 AI 智能体设计的综合开发平台,内置可观测性能力。提供智能体专项监控、分析仪表盘及实时性能追踪,并附带成本优化洞察。支持与主流智能体框架集成,包括 LangChain、AutoGen 和 CrewAI。

LangSmith

平台LangSmith

LangChain 官方的可观测性与评测平台。提供链路可视化、调试工具、性能分析及数据集管理,与 LangChain/LangGraph 生态深度集成。支持提示词版本控制、A/B 测试及自动化评测流水线。

Galileo

平台Galileo

专为多智能体系统打造的智能体可靠性平台,核心能力如下:

  • 图引擎(Graph Engine):追踪复杂的智能体执行路径,直观呈现多智能体工作流中的每个分支、决策节点及工具调用
  • 洞察引擎(Insights Engine):识别故障模式,并提供与具体组件挂钩的可操作改进建议
  • 链路视图(Trace View):可折叠界面,完整展示执行路径,含嵌套智能体调用与决策节点
  • 图视图(Graph View):映射多智能体工作流,呈现跨会话的协调模式与信息流向
  • 时间轴视图(Timeline View):按阶段(智能体通信、检索、生成)分解耗时,快速定位性能瓶颈
  • 日志流洞察(Log Stream Insights):实时错误检测(含堆栈跟踪)、分布式智能体间相关事件自动关联、针对重复协调问题的模式匹配
  • 自定义指标(Custom Metrics):通过 LLM 评审(如 GPT-4o)定义与业务相关的自定义指标

Galileo 追踪三个维度:会话层(任务是否完成?)、步骤层(各项决策是否正确?)和系统层(跨会话的规律是什么?)。原生支持 LangGraph、CrewAI 等框架,可通过 GalileoAsyncCallback 集成到 LangGraph 流水线。

专业可观测性平台

Langfuse

平台Langfuse

YC W23 孵化的开源 LLM 可观测性平台。提供完整的链路追踪、评测及提示词管理功能,支持指标采集与分析,助力调试与优化。可自托管或使用云托管版本,社区接受度高,提供 Python 与 TypeScript 原生 SDK。

Openlit

平台Openlit

基于 OpenTelemetry 构建的开源 AI 工程平台。提供 LLM 可观测性、GPU 监控、护栏、评测、提示词管理及内置 Playground。OpenTelemetry 原生设计确保与现有可观测性基础设施兼容。

Weights & Biases (W&B) Weave

平台W&B Weave

面向 LLM 应用的追踪、实验、评测、部署与持续改进框架。将 W&B 的实验追踪能力延伸至生产环境 LLM 系统,提供模型对比、提示词迭代追踪及协作开发功能。

Braintrust

平台Braintrust

专注于在生产环境中度量、评测并持续改进 AI 能力的可观测性平台。具备模型对比、提示词迭代追踪、基于真实用户数据的回归检测及持续改进工作流,适合需要快速迭代生产 AI 系统的团队。

Comet Opik

平台Comet Opik

企业级 ML 可观测性平台,提供实验追踪、模型监控、性能分析及团队协作功能。将 Comet 成熟的 ML 追踪能力延伸至 LLM 与智能体工作负载。

agenttrace

平台agenttrace

面向 AI 编码智能体会话历史的开源本地 TUI 工具与报告生成器。可读取 Claude Code、Codex CLI、Gemini CLI、Qwen Code、Cursor、Aider、OpenCode 及 Copilot 风格工具的本地日志,汇总 Token 用量、预估成本、延迟、工具失败情况及会话健康状态,无需将提示词或代码上传至任何托管服务。

平台对比

平台 开源 企业级 实时监控 成本追踪 评测工具
AgentOps
LangSmith
Galileo
Langfuse
Openlit
W&B Weave
Braintrust
Comet Opik
agenttrace

基础设施层可观测性

OpenTelemetry

OpenTelemetry 标准提供厂商中立的链路、指标与日志插桩规范。众多 AI 可观测性平台(如 Openlit、Langfuse)均基于 OpenTelemetry 构建,可与现有可观测性技术栈(Jaeger、Zipkin、Prometheus、Grafana)无缝集成。

传统 APM 集成

对于企业级部署,AI 可观测性通常需与现有 APM 工具整合: - Datadog:LLM 可观测性附加模块,支持链路关联 - New Relic:面向 LLM 应用的 AI 监控能力 - Dynatrace:支持 LLM 的 AI 驱动可观测性 - Prometheus + Grafana:开源指标采集与可视化方案

选型指南

初创团队与小型团队

推荐从 Langfuse(开源、可自托管)或 LangSmith(LangChain 技术栈)入手。初期聚焦链路追踪与成本追踪,待系统成熟后再逐步引入评测能力。

编码智能体开发

当链路数据已存储于本地编码智能体日志、且团队需要以终端为主的成本、延迟与回归报告而无需接入托管可观测性后端时,选用 agenttrace

企业级组织

可考虑 BraintrustW&B Weave 以获得全面覆盖。同时与现有企业监控工具(Datadog、Splunk)集成,实现统一可观测性。建议在技术指标之外同步实施自定义业务指标。

研究与开发场景

W&B WeaveComet Opik 在实验追踪与模型对比方面表现出色。优先关注可复现性与详细日志记录,而非生产规模下的性能优化。

最佳实践

  1. 从链路追踪起步:完整的请求链路追踪在早期能提供最大的调试价值
  2. 循序渐进地引入评测:先从自动化指标开始,再逐步加入人工评测
  3. 立即设置成本告警:缺乏护栏时 Token 成本可能迅速失控
  4. 生产环境采用采样策略:100% 全量采集成本高昂,应进行智能采样
  5. 与业务指标关联:将技术指标与业务结果挂钩

参见