跳转至

治理最佳实践

概述

治理最佳实践将高层政策转化为可重复执行的工程管控与运营管控。对于智能体 AI 系统而言,最关键的管控措施需针对自主行动带来的独特风险:多步骤工具调用、非确定性决策、访问敏感数据,以及难以将结果归因到具体模型决策等问题。

人在回路(HITL)管控

人工监督是对高影响力智能体行动的首要保障。有效的人在回路(HITL)实现需要明确的设计,而非临时干预:

模式 适用时机 实现说明
审批门控 在执行不可逆或高价值操作之前(如金融交易、数据删除、对外通信) 智能体暂停执行,呈现拟采取的操作及其理由,等待人工明确审批后再继续
影子模式 初始生产发布期间,或能力变更后 智能体生成建议,由人工执行;记录智能体与人工决策的差异,用于偏差检测
置信度阈值 当智能体对某项决策的置信度低于预设值时 低置信度状态路由至人工审核队列,智能体在问题解决前暂停执行
定期检查点 对于长时间运行的自主工作流 智能体按设定间隔暂停(如每 N 步操作或 T 分钟),汇报进度并请求继续执行的确认
异常上报 当智能体检测到意外状态或分布外输入时 智能体上报异常并停止执行,而非带着可能错误的判断继续推进

审计追踪要求

智能体系统的完整审计追踪必须记录以下内容:

  • 输入:原始用户提示词、检索到的上下文、反馈给模型的工具输出
  • 模型决策:所选操作及推理过程(思维链或结构化理由)
  • 工具调用:每一次外部调用(API、数据库、文件系统)的传入参数、收到的响应及时间戳
  • 人工交互:审批/拒绝决策、覆盖事件及审核人身份
  • 输出:交付给用户或下游系统的最终响应
  • 系统状态:执行时的智能体版本、模型版本及配置快照

审计日志必须满足以下要求: - 防篡改:存储于追加写入(append-only)系统中,并使用密码学完整性校验 - 可查询:采用结构化格式(JSON 或列式存储),支持取证调查与合规报告 - 按规留存:依据适用法规要求留存(高风险领域通常为 3 至 7 年) - 访问受控:仅限授权审核人访问,并留存访问日志

偏见与公平性监控

凡是对人做出或影响决策的智能体系统,均需持续开展偏见监控:

领域 挑战 实践建议
训练数据偏见 LLM 会继承预训练数据中的偏见 记录已知局限性;在部署前针对不同人口子群组进行测试
检索偏见 RAG 系统可能倾向于返回反映历史规律的文档 跨人口维度审计检索结果;采用多样性感知重排序
决策差异 智能体推荐可能在受保护群体间存在系统性差异 定义公平性指标(人口统计均等、机会均等),定期开展差异审计
反馈循环放大 智能体行动影响未来数据,进而用于训练未来模型 监控分布漂移;在评测套件中纳入对抗样本和边缘案例

数据治理

从企业系统中检索和处理数据的智能体,必须在智能体层强制执行数据治理:

  • 数据分类标签传递到智能体的上下文窗口——智能体不得将已分类数据路由至缺乏相应许可的工具或服务
  • PII 最小化:在向外部 LLM 提供商发送数据前,须对个人数据进行脱敏或假名化处理,除非已签署相应的数据处理协议
  • 目的限制:智能体的访问范围限定于特定数据域;访问范围外的数据源需经明确授权
  • 留存策略:临时性智能体上下文(对话历史、工作记忆)必须按计划清除;长期记忆存储适用与底层数据相同的留存规则

模型与提示词版本管理

实践 说明
为每个提示词建立版本 将系统提示词与应用代码一同存入版本控制系统,并标记发布版本
金丝雀提示词发布 在全量部署前,先将提示词变更推送至少量流量;对比评测指标
提示词回归测试 维护一组精选的黄金输入与预期输出;在 CI 中对每次提示词变更运行测试
模型版本锁定 在生产环境中锁定特定模型版本;在提升前先在预发布环境中测试新模型版本
变更归因 将每个生产事故追溯至当时生效的具体提示词版本、模型版本或配置变更

事故响应

每个生产智能体部署都需要有文档化的事故响应预案:

  1. 检测:监控告警在操作异常率、错误峰值或 HITL 上报量出现异常时触发
  2. 遏制:熔断开关与功能标志支持即时禁用特定智能体能力,无需全量回滚
  3. 调查:结构化审计日志支持根因分析;通过查询定位产生事故的具体决策链
  4. 修复:修正提示词、工具或配置;通过金丝雀发布结合回归测试部署变更
  5. 复盘:记录根本原因、促成因素、时间线及预防性管控措施;向治理相关方分享复盘结论
  6. 监管通报:对于受欧盟 AI 法案或行业特定法规约束的高风险 AI 系统,严重事故可能触发强制报告义务

红队演练与对抗测试

在高自主度智能体上线生产前,须开展结构化对抗测试:

  • 提示词注入:尝试通过用户输入或检索文档覆盖系统提示词指令
  • 范围蔓延:构造引导智能体超出授权域的输入
  • 权限提升:测试智能体是否可被操纵使用其无权访问的工具或数据源
  • 压力下的幻觉:验证智能体在被询问知识范围外的信息时,是否选择拒绝而非捏造
  • 多智能体串谋:在多智能体系统中,测试被攻陷的子智能体是否能操纵编排者行为

将测试案例、测试结果及残余风险记录至系统风险登记册。在模型、提示词或工具发生重大变更后,须重新执行对抗测试。

治理度量指标

将以下指标作为治理健康度的先行指标进行跟踪:

指标 信号含义
HITL 上报率 触发人工审核的智能体运行占比;急剧上升表明智能体出现意外行为
操作撤销率 执行后被人工撤销的智能体操作占比;高撤销率表明自主边界校准有误
策略违规事件数 试图突破访问控制或数据处理策略的次数(含被拦截和成功的)
审计日志完整性 具备完整、可解析审计日志的智能体运行占比;存在缺口表明埋点存在故障
公平性差异评分 智能体在不同人口子群组间推荐率的差异;按滚动周期监控
模型/提示词变更频率 配置变更的部署频率;若高频变更且测试覆盖不足,则为风险信号

Google 智能体 ROI 框架

Google AI 框架

Google AI 框架

Google AI 框架

参考:https://www.youtube.com/watch?v=aqvYd8c36gg&t=1s

参见

参考资料