治理最佳实践
概述
治理最佳实践将高层政策转化为可重复执行的工程管控与运营管控。对于智能体 AI 系统而言,最关键的管控措施需针对自主行动带来的独特风险:多步骤工具调用、非确定性决策、访问敏感数据,以及难以将结果归因到具体模型决策等问题。
人在回路(HITL)管控
人工监督是对高影响力智能体行动的首要保障。有效的人在回路(HITL)实现需要明确的设计,而非临时干预:
| 模式 | 适用时机 | 实现说明 |
|---|---|---|
| 审批门控 | 在执行不可逆或高价值操作之前(如金融交易、数据删除、对外通信) | 智能体暂停执行,呈现拟采取的操作及其理由,等待人工明确审批后再继续 |
| 影子模式 | 初始生产发布期间,或能力变更后 | 智能体生成建议,由人工执行;记录智能体与人工决策的差异,用于偏差检测 |
| 置信度阈值 | 当智能体对某项决策的置信度低于预设值时 | 低置信度状态路由至人工审核队列,智能体在问题解决前暂停执行 |
| 定期检查点 | 对于长时间运行的自主工作流 | 智能体按设定间隔暂停(如每 N 步操作或 T 分钟),汇报进度并请求继续执行的确认 |
| 异常上报 | 当智能体检测到意外状态或分布外输入时 | 智能体上报异常并停止执行,而非带着可能错误的判断继续推进 |
审计追踪要求
智能体系统的完整审计追踪必须记录以下内容:
- 输入:原始用户提示词、检索到的上下文、反馈给模型的工具输出
- 模型决策:所选操作及推理过程(思维链或结构化理由)
- 工具调用:每一次外部调用(API、数据库、文件系统)的传入参数、收到的响应及时间戳
- 人工交互:审批/拒绝决策、覆盖事件及审核人身份
- 输出:交付给用户或下游系统的最终响应
- 系统状态:执行时的智能体版本、模型版本及配置快照
审计日志必须满足以下要求: - 防篡改:存储于追加写入(append-only)系统中,并使用密码学完整性校验 - 可查询:采用结构化格式(JSON 或列式存储),支持取证调查与合规报告 - 按规留存:依据适用法规要求留存(高风险领域通常为 3 至 7 年) - 访问受控:仅限授权审核人访问,并留存访问日志
偏见与公平性监控
凡是对人做出或影响决策的智能体系统,均需持续开展偏见监控:
| 领域 | 挑战 | 实践建议 |
|---|---|---|
| 训练数据偏见 | LLM 会继承预训练数据中的偏见 | 记录已知局限性;在部署前针对不同人口子群组进行测试 |
| 检索偏见 | RAG 系统可能倾向于返回反映历史规律的文档 | 跨人口维度审计检索结果;采用多样性感知重排序 |
| 决策差异 | 智能体推荐可能在受保护群体间存在系统性差异 | 定义公平性指标(人口统计均等、机会均等),定期开展差异审计 |
| 反馈循环放大 | 智能体行动影响未来数据,进而用于训练未来模型 | 监控分布漂移;在评测套件中纳入对抗样本和边缘案例 |
数据治理
从企业系统中检索和处理数据的智能体,必须在智能体层强制执行数据治理:
- 数据分类标签传递到智能体的上下文窗口——智能体不得将已分类数据路由至缺乏相应许可的工具或服务
- PII 最小化:在向外部 LLM 提供商发送数据前,须对个人数据进行脱敏或假名化处理,除非已签署相应的数据处理协议
- 目的限制:智能体的访问范围限定于特定数据域;访问范围外的数据源需经明确授权
- 留存策略:临时性智能体上下文(对话历史、工作记忆)必须按计划清除;长期记忆存储适用与底层数据相同的留存规则
模型与提示词版本管理
| 实践 | 说明 |
|---|---|
| 为每个提示词建立版本 | 将系统提示词与应用代码一同存入版本控制系统,并标记发布版本 |
| 金丝雀提示词发布 | 在全量部署前,先将提示词变更推送至少量流量;对比评测指标 |
| 提示词回归测试 | 维护一组精选的黄金输入与预期输出;在 CI 中对每次提示词变更运行测试 |
| 模型版本锁定 | 在生产环境中锁定特定模型版本;在提升前先在预发布环境中测试新模型版本 |
| 变更归因 | 将每个生产事故追溯至当时生效的具体提示词版本、模型版本或配置变更 |
事故响应
每个生产智能体部署都需要有文档化的事故响应预案:
- 检测:监控告警在操作异常率、错误峰值或 HITL 上报量出现异常时触发
- 遏制:熔断开关与功能标志支持即时禁用特定智能体能力,无需全量回滚
- 调查:结构化审计日志支持根因分析;通过查询定位产生事故的具体决策链
- 修复:修正提示词、工具或配置;通过金丝雀发布结合回归测试部署变更
- 复盘:记录根本原因、促成因素、时间线及预防性管控措施;向治理相关方分享复盘结论
- 监管通报:对于受欧盟 AI 法案或行业特定法规约束的高风险 AI 系统,严重事故可能触发强制报告义务
红队演练与对抗测试
在高自主度智能体上线生产前,须开展结构化对抗测试:
- 提示词注入:尝试通过用户输入或检索文档覆盖系统提示词指令
- 范围蔓延:构造引导智能体超出授权域的输入
- 权限提升:测试智能体是否可被操纵使用其无权访问的工具或数据源
- 压力下的幻觉:验证智能体在被询问知识范围外的信息时,是否选择拒绝而非捏造
- 多智能体串谋:在多智能体系统中,测试被攻陷的子智能体是否能操纵编排者行为
将测试案例、测试结果及残余风险记录至系统风险登记册。在模型、提示词或工具发生重大变更后,须重新执行对抗测试。
治理度量指标
将以下指标作为治理健康度的先行指标进行跟踪:
| 指标 | 信号含义 |
|---|---|
| HITL 上报率 | 触发人工审核的智能体运行占比;急剧上升表明智能体出现意外行为 |
| 操作撤销率 | 执行后被人工撤销的智能体操作占比;高撤销率表明自主边界校准有误 |
| 策略违规事件数 | 试图突破访问控制或数据处理策略的次数(含被拦截和成功的) |
| 审计日志完整性 | 具备完整、可解析审计日志的智能体运行占比;存在缺口表明埋点存在故障 |
| 公平性差异评分 | 智能体在不同人口子群组间推荐率的差异;按滚动周期监控 |
| 模型/提示词变更频率 | 配置变更的部署频率;若高频变更且测试覆盖不足,则为风险信号 |
Google 智能体 ROI 框架
参考:https://www.youtube.com/watch?v=aqvYd8c36gg&t=1s
参见
参考资料
- NIST AI Risk Management Framework 1.0 — Map、Measure、Manage 功能为管控设计提供参照
- EU AI Act — 第 9 条(风险管理)、第 12 条(记录保存)、第 14 条(人工监督)
- OWASP Top 10 for LLM Applications — 提示词注入、不安全输出处理及其他智能体特有风险


