跳转至

智能体 AI 安全

本节全面覆盖构建安全智能体 AI 系统所需的安全框架、标准与最佳实践。从 NIST AI RMF 等行业标准,到 Google 和 AWS 的厂商专项安全方案,本集合提供了在生产环境中安全部署 AI 智能体所必需的核心安全指南。

概述

保护智能体 AI 系统需要针对其独特风险采用专项方法,这些风险包括:越权行为、敏感数据泄露以及自主决策带来的隐患。本节涵盖以下内容:

  • 安全标准:行业标准框架与指南
  • 厂商视角:主要云厂商的安全方案
  • 风险管理:识别与缓解 AI 特有风险的框架
  • 实施指南:保护 AI 智能体的实践方法

安全标准

NIST AI RMF(风险管理框架)

NIST AI 风险管理框架(AI RMF) 为管理人工智能系统相关风险提供了系统性方法。

核心资源: - 框架文档NIST AI RMF 1.0 - 实施指南NIST Playbook

NIST AI 风险管理框架概览,展示 AI 风险管理的综合方法

NIST AI RMF 通过四项核心职能提供 AI 风险管理的结构化方法:

NIST AI RMF 环形流程图,阐释四项核心职能:治理(Govern)、映射(Map)、度量(Measure)与管理(Manage)

框架组件:

NIST AI RMF 框架组件图,展示详细结构与关联关系

核心特性: - 面向 AI 系统治理的基于风险的方法 - 从设计到部署的全生命周期集成 - 跨组织层级的利益相关方参与 - 持续监控与改进流程 - 可适配多种组织场景的灵活实施

实施收益: - 系统化识别 AI 相关风险 - 提供结构化的风险缓解路径 - 满足监管合规要求 - 增强利益相关方信心 - 提升 AI 系统的可靠性与安全性

Google 视角

智能体安全运营中心(SOC)

Google 的 智能体 SOC 代表了一种现代化安全运营模式——超越传统自动化,构建由自主 AI 智能体驱动的系统。这些智能体能够独立推理、决策并执行复杂的安全任务,同时保持人类分析师的全程掌控。

Google 安全 AI 框架(SAIF)

Google 安全 AI 框架(SAIF) 为 AI 系统提供了全面的安全指导。

延伸资源: - Google 的安全 AI 智能体方法

AI 智能体安全风险与原则

Google AI 智能体安全风险与原则图,概述关键安全考量

已识别的关键风险: - 风险 1:越权行为 — 智能体执行未经授权或有害的操作 - 风险 2:敏感数据泄露 — 无意中暴露机密信息

安全原则: - 原则 1:智能体必须有明确定义的人类控制者 - 原则 2:智能体的权限必须受到限制 - 原则 3:智能体的行为与规划必须可观测

三层防御体系

Google 针对 AI 智能体的三层防御示意图,展示策略定义、护栏与人工监督

Google 的安全方案实现了三个相互补充的防御层次:

1. 策略定义与系统指令(智能体的"宪法")

首先定义智能体期望与非期望行为的策略,并将其工程化为系统指令(SI),作为智能体的核心行为准则。

2. 护栏、防护措施与过滤(执行层)

该层作为硬性执行机制:

  • 输入过滤:使用分类器及 Perspective API 等服务分析提示词,在恶意输入到达智能体前予以拦截
  • 输出过滤:Vertex AI 内置安全过滤器对有害内容、个人身份信息(PII)或违规内容进行最终审查
  • 人在回路(HITL)升级:对于高风险或模糊操作,系统必须暂停并上报人工审核

3. 监控与响应

持续监控智能体行为,并对检测到的异常情况具备自动化响应能力。

SAIF 框架实施

Google 安全 AI 框架https://saif.google/

交互式实施地图https://saif.google/secure-ai-framework/saif-map

Google 安全 AI 框架(SAIF)图,展示综合安全方法

SAIF 框架组件: - 安全基础:建立安全的基础设施与开发实践 - 安全开发:在 AI 开发生命周期全程落实安全措施 - 安全部署:确保部署与运营实践符合安全要求 - 安全运营:通过持续运营与监控维持安全态势

AWS 视角

生成式 AI 安全范围矩阵

AWS 推出了 生成式 AI 安全范围矩阵,帮助各组织理解并应对基础模型(FM)应用的独特安全挑战。

AI 安全范围矩阵是一个综合框架,旨在帮助组织在 AI 全生命周期内评估并实施安全控制措施,将安全考量细分为具体类别,以便有针对性地保护 AI 应用。

AWS 智能体 AI 安全范围矩阵,展示 AI 全生命周期的综合安全控制

核心特性: - 全生命周期覆盖:从开发到部署的安全考量 - 风险分类:识别和应对风险的结构化方法 - 控制映射:针对不同 AI 应用类型的专项安全控制 - 合规对齐:框架与监管要求的一致性

实施领域: - 数据安全:保护训练数据及模型输入/输出 - 模型安全:保护 AI 模型本身 - 基础设施安全:保护底层计算与存储基础设施 - 应用安全:保护使用 AI 模型的应用程序 - 运营安全:持续的安全监控与事件响应

实施最佳实践

面向开发团队

  1. 实施纵深防御:参照 Google 方案采用多层安全防护
  2. 遵循 NIST AI RMF:采用结构化的风险管理实践
  3. 使用厂商框架:充分利用云厂商的安全工具与框架
  4. 持续监控:实施持续的安全监控与告警机制

面向企业级组织

  1. 采纳综合框架:实施 NIST AI RMF 或同类综合框架
  2. 厂商专项安全:利用云厂商安全服务(Google SAIF、AWS 安全矩阵)
  3. 人工监督:对关键决策保持人在回路的管控
  4. 定期评估:定期开展安全评估与渗透测试

面向合规与治理

  1. 风险文档化:维护全面的风险登记册与缓解计划
  2. 策略制定:制定清晰的 AI 治理策略与流程
  3. 利益相关方参与:确保跨职能部门共同参与 AI 安全工作
  4. 监管对齐:将安全实践与相关监管要求保持一致

各应用场景的安全考量

高风险应用

  • 金融服务与交易系统
  • 医疗健康与医学诊断
  • 关键基础设施控制
  • 自动驾驶系统

附加控制措施: - 强化人工监督要求 - 更严格的访问控制与身份验证 - 实时监控与告警 - 完整的审计跟踪

中等风险应用

  • 客户服务与支持
  • 内容生成与营销
  • 业务流程自动化
  • 数据分析与报告

标准控制措施: - 定期安全评估 - 标准访问控制 - 监控与日志记录 - 事件响应流程

低风险应用

  • 内部生产力工具
  • 研究与开发
  • 非关键自动化
  • 教育类应用

基础控制措施: - 基础访问控制 - 标准监控 - 定期更新与补丁 - 用户培训与安全意识

新兴安全挑战

AI 特有威胁

  • 提示词注入:旨在操控 AI 行为的恶意输入
  • 模型投毒:针对训练数据或模型参数的攻击
  • 数据提取:尝试窃取敏感训练数据
  • 对抗样本:专门设计以导致错误分类的输入

缓解策略

  • 输入验证:对 AI 系统的所有输入进行全面验证
  • 输出过滤:对 AI 生成的输出进行过滤与验证
  • 模型监控:持续监控模型行为与性能
  • 安全训练:采用安全的模型训练与数据处理实践

上述安全框架为构建可信、安全、合规的智能体 AI 系统奠定了基础,使其能够在生产环境中安全运行,同时保留 AI 智能体的灵活性与核心价值。

Microsoft 视角

Agent Governance Toolkit

Microsoft 的 Agent Governance Toolkit(AGT) 采用中间件层方法实现运行时治理——在每个智能体动作执行前,对其施加确定性策略执行、零信任身份认证与执行沙箱隔离。主要特点:

  • 策略引擎:支持 YAML / OPA Rego / Cedar 规则,p50 延迟仅 0.012 ms;故障关闭设计确保策略违规通过率为 0.00%
  • 零信任身份:Ed25519 + 量子安全的 ML-DSA-65 凭证;行为信任评分(0–1000),异常行为时自动衰减;兼容 SPIFFE/SVID
  • 执行环:四个硬件启发式权限级别;Saga 编排与自动补偿;集群级熔断开关
  • MCP 安全网关:工具投毒检测、描述漂移监控、针对 Model Context Protocol 工具的域名抢注检查
  • 智能体 SRE:SLO、错误预算、熔断器、回放调试、OpenTelemetry 原生治理事件
  • 合规性:Merkle 链式审计日志、Decision BOM、EU AI Act / SOC 2 / HIPAA / GDPR 自动化合规证据
  • OWASP 覆盖:覆盖全部 10 项 OWASP Agentic Top 10 风险;在 10 项正式规范中累计 13,000+ 测试
  • 适配器:支持 20+ 框架(LangChain、AutoGen、CrewAI、Semantic Kernel、Google ADK、OpenAI Agents SDK 等);提供 Python、TypeScript、.NET、Rust、Go SDK

详见 Agent Governance Toolkit

Anthropic 视角

Anthropic Sandbox Runtime

Anthropic 的 Sandbox Runtime(srt 是一款轻量级操作系统级沙箱工具,无需容器即可对任意进程施加文件系统与网络限制。其主要用途是将 MCP 服务器封装在最小权限执行环境中:

  • 文件系统隔离:拒绝后允许策略,仅开放显式路径白名单
  • 网络隔离:通过 HTTP/SOCKS5 代理实现仅允许模式,屏蔽所有未列入白名单的域名
  • OS 原生机制:macOS Seatbelt(sandbox-exec)与 Linux bubblewrap——开销低于 Docker
  • 违规监控:实时违规告警,支持取证与可观测性集成

安装方式:npm install -g @anthropic-ai/sandbox-runtime(Apache-2.0 协议,约 4.1k stars)

详见 Anthropic Sandbox Runtime

智能体沙箱——跨厂商概览

如需全面比较云托管与本地沙箱方案(E2B、Daytona、Modal、Firecracker、gVisor、Kata Containers、nsjail 等),请参阅 智能体沙箱 参考页。

CSA 视角

智能体 AI 红队演练指南

云安全联盟(CSA) AI 组织责任工作组发布了 智能体 AI 红队演练指南(2025 年 8 月),定义了专门针对自主、多步骤、工具调用型智能体的实践测试方法论——有别于单轮 LLM 红队演练。

12 个威胁类别:智能体授权与控制劫持、监督者脱离回路、智能体关键系统交互、智能体目标与指令操控、智能体幻觉利用、智能体影响链与爆炸半径、智能体知识库投毒、智能体记忆与上下文操控、智能体编排与多智能体利用、智能体资源与服务耗尽、智能体供应链与依赖攻击,以及智能体不可追踪性。

四阶段测试方法论:准备 → 执行 → 分析 → 报告,并配套互补的威胁建模框架(MAESTRO)。

详见 智能体 AI 红队演练指南(CSA),获取完整威胁分类、可操作测试步骤及工具全景(AgentDojo、Agent-SafetyBench、SplxAI Agentic Radar、Azure AI Red Teaming Agent 等)。

AI 智能体技能安全扫描器

随着智能体技能(SKILLS.md / .claude/commands/*.md)成为智能体工作流的主要分发单元,扫描其中潜藏的威胁已成为一门独立的安全专项。研究显示,26.1% 的技能存在漏洞,5.2% 显示出明显的恶意意图。

以下两款开源工具专门应对技能供应链安全问题:

工具 厂商 核心优势
Skill Scanner Cisco AI Defense 多引擎共识(YARA + AST + LLM + VirusTotal);交互式 HTML 报告;SARIF/GitHub Actions 集成
SkillSpector NVIDIA 涵盖 16 个类别的 64 种检测模式;实时 OSV.dev CVE 查询;MCP 专项风险检测;LangGraph 流水线

详见 AI 智能体技能安全扫描器,获取完整介绍、CLI 用法与威胁模型对比。

教育资源

Learn Prompt Hacking

Learn Prompt Hacking(TrustAI-laboratory)是一个开源、课程式资源库,涵盖 ChatGPT 越狱、针对 GPT Assistants/自定义 GPT 的提示词注入,以及 LLM 应用的红队/蓝队防御技术——它是智能体红队演练的单轮前置学科。

详见 Learn Prompt Hacking

参见