可观测性目标与指标
概述
智能体 AI 系统的可观测性(Observability)远不止传统应用监控。除常规运营指标外,还需追踪 AI 特有行为、决策过程及质量指标。其核心目标是对智能体的行动、原因和表现保持全面可见性。
核心可观测性目标
性能监控
- 追踪响应时间、吞吐量和资源利用率
- 监控模型推理延迟与 Token 处理速率
- 衡量系统可用性与可靠性指标
- 识别智能体推理与工具执行链中的性能瓶颈
行为分析
- 理解智能体的决策过程与推理路径
- 追踪对话流程与多轮交互模式
- 监控工具调用频率、成功率及失败模式
- 检测意外或异常的智能体行为
质量保障
- 检测智能体输出中的幻觉与事实错误
- 监控输出的相关性、连贯性与准确性
- 追踪用户满意度评分与反馈信号
- 衡量任务完成率与目标达成情况
成本管理
- 按请求、会话和模型维度监控 Token 用量
- 追踪不同部署配置下的基础设施成本
- 识别成本优化机会(缓存、模型路由)
- 设置成本预算并通过告警机制加以执行
安全与合规
- 监控输入输出中的敏感数据暴露情况
- 追踪访问模式与认证事件
- 检测提示词注入(Prompt injection)尝试及对抗性输入
- 确保符合数据保护法规(GDPR、HIPAA 等)
AI 可观测性核心指标
运营指标
- 请求量与请求速率(每秒请求数)
- 响应延迟(P50、P95、P99 百分位)
- 错误率与各类别失败模式
- 资源利用率(CPU、内存、GPU)
- 队列深度与处理积压
AI 专项指标
- Token 消耗(输入 Token、输出 Token、总成本)
- 模型准确率与置信度评分
- 幻觉检测率
- 工具调用成功率与失败率
- 上下文窗口利用率
- 检索相关性评分(适用于 RAG 系统)
业务指标
- 用户参与度与会话时长
- 任务完成率
- 业务结果关联性(如客服智能体的问题解决率)
- 每次智能体交互的 ROI 与价值实现
- 人工升级率(适用于人在回路(HITL)的智能体)
AI 智能体可观测性的四大支柱
链路追踪(Traces)
端到端链路(Traces)完整记录智能体请求的执行路径,包括: - LLM 调用的提示词与补全内容 - 工具调用及其结果 - 记忆的读写操作 - 多智能体系统中的子智能体调用 - 每个步骤的延迟耗时
指标(Metrics)
用于仪表盘展示与告警的聚合数值数据,包括: - 用于趋势分析的时序数据 - 延迟分布直方图 - 事件频率计数器 - 当前状态仪表(如活跃会话数)
日志(Logs)
用于调试与审计的结构化事件记录,包括: - 智能体推理步骤与中间输出 - 错误信息与堆栈跟踪 - 用户输入与智能体响应(含 PII 脱敏处理) - 配置变更与部署记录
评测(Evaluations)
自动化质量评估,包括: - 基于 LLM 充当评审(LLM-as-judge)的响应质量评分 - 自动化幻觉检测 - 相关性与事实接地性评分 - 基于黄金数据集的回归测试
实施原则
尽早埋点
从智能体架构设计之初就集成可观测性,而非事后补接。采用兼容 OpenTelemetry 的埋点方案,确保跨平台可移植性。
全面关联
使用关联 ID 将分布式智能体系统中的链路(Traces)、日志和指标串联起来。这对调试多智能体工作流至关重要。
权衡细粒度与成本
大规模场景下,全量链路采集成本高昂。建议采用采样策略:对错误请求 100% 采集,对成功请求按代表性比例采样。
保护隐私
在记录用户输入前,先进行 PII 检测与脱敏。确保可观测性数据与生产环境数据遵循相同的数据治理(Governance)策略。