跳转至

可观测性目标与指标

概述

智能体 AI 系统的可观测性(Observability)远不止传统应用监控。除常规运营指标外,还需追踪 AI 特有行为、决策过程及质量指标。其核心目标是对智能体的行动、原因和表现保持全面可见性。

核心可观测性目标

性能监控

  • 追踪响应时间、吞吐量和资源利用率
  • 监控模型推理延迟与 Token 处理速率
  • 衡量系统可用性与可靠性指标
  • 识别智能体推理与工具执行链中的性能瓶颈

行为分析

  • 理解智能体的决策过程与推理路径
  • 追踪对话流程与多轮交互模式
  • 监控工具调用频率、成功率及失败模式
  • 检测意外或异常的智能体行为

质量保障

  • 检测智能体输出中的幻觉与事实错误
  • 监控输出的相关性、连贯性与准确性
  • 追踪用户满意度评分与反馈信号
  • 衡量任务完成率与目标达成情况

成本管理

  • 按请求、会话和模型维度监控 Token 用量
  • 追踪不同部署配置下的基础设施成本
  • 识别成本优化机会(缓存、模型路由)
  • 设置成本预算并通过告警机制加以执行

安全与合规

  • 监控输入输出中的敏感数据暴露情况
  • 追踪访问模式与认证事件
  • 检测提示词注入(Prompt injection)尝试及对抗性输入
  • 确保符合数据保护法规(GDPR、HIPAA 等)

AI 可观测性核心指标

运营指标

  • 请求量与请求速率(每秒请求数)
  • 响应延迟(P50、P95、P99 百分位)
  • 错误率与各类别失败模式
  • 资源利用率(CPU、内存、GPU)
  • 队列深度与处理积压

AI 专项指标

  • Token 消耗(输入 Token、输出 Token、总成本)
  • 模型准确率与置信度评分
  • 幻觉检测率
  • 工具调用成功率与失败率
  • 上下文窗口利用率
  • 检索相关性评分(适用于 RAG 系统)

业务指标

  • 用户参与度与会话时长
  • 任务完成率
  • 业务结果关联性(如客服智能体的问题解决率)
  • 每次智能体交互的 ROI 与价值实现
  • 人工升级率(适用于人在回路(HITL)的智能体)

AI 智能体可观测性的四大支柱

链路追踪(Traces)

端到端链路(Traces)完整记录智能体请求的执行路径,包括: - LLM 调用的提示词与补全内容 - 工具调用及其结果 - 记忆的读写操作 - 多智能体系统中的子智能体调用 - 每个步骤的延迟耗时

指标(Metrics)

用于仪表盘展示与告警的聚合数值数据,包括: - 用于趋势分析的时序数据 - 延迟分布直方图 - 事件频率计数器 - 当前状态仪表(如活跃会话数)

日志(Logs)

用于调试与审计的结构化事件记录,包括: - 智能体推理步骤与中间输出 - 错误信息与堆栈跟踪 - 用户输入与智能体响应(含 PII 脱敏处理) - 配置变更与部署记录

评测(Evaluations)

自动化质量评估,包括: - 基于 LLM 充当评审(LLM-as-judge)的响应质量评分 - 自动化幻觉检测 - 相关性与事实接地性评分 - 基于黄金数据集的回归测试

实施原则

尽早埋点

从智能体架构设计之初就集成可观测性,而非事后补接。采用兼容 OpenTelemetry 的埋点方案,确保跨平台可移植性。

全面关联

使用关联 ID 将分布式智能体系统中的链路(Traces)、日志和指标串联起来。这对调试多智能体工作流至关重要。

权衡细粒度与成本

大规模场景下,全量链路采集成本高昂。建议采用采样策略:对错误请求 100% 采集,对成功请求按代表性比例采样。

保护隐私

在记录用户输入前,先进行 PII 检测与脱敏。确保可观测性数据与生产环境数据遵循相同的数据治理(Governance)策略。

参见