智能体 AI 安全
本节全面覆盖构建安全智能体 AI 系统所需的安全框架、标准与最佳实践。从 NIST AI RMF 等行业标准,到 Google 和 AWS 的厂商专项安全方案,本集合提供了在生产环境中安全部署 AI 智能体所必需的核心安全指南。
概述
保护智能体 AI 系统需要针对其独特风险采用专项方法,这些风险包括:越权行为、敏感数据泄露以及自主决策带来的隐患。本节涵盖以下内容:
- 安全标准:行业标准框架与指南
- 厂商视角:主要云厂商的安全方案
- 风险管理:识别与缓解 AI 特有风险的框架
- 实施指南:保护 AI 智能体的实践方法
安全标准
NIST AI RMF(风险管理框架)
NIST AI 风险管理框架(AI RMF) 为管理人工智能系统相关风险提供了系统性方法。
核心资源: - 框架文档:NIST AI RMF 1.0 - 实施指南:NIST Playbook
NIST AI RMF 通过四项核心职能提供 AI 风险管理的结构化方法:
框架组件:
核心特性: - 面向 AI 系统治理的基于风险的方法 - 从设计到部署的全生命周期集成 - 跨组织层级的利益相关方参与 - 持续监控与改进流程 - 可适配多种组织场景的灵活实施
实施收益: - 系统化识别 AI 相关风险 - 提供结构化的风险缓解路径 - 满足监管合规要求 - 增强利益相关方信心 - 提升 AI 系统的可靠性与安全性
Google 视角
智能体安全运营中心(SOC)
Google 的 智能体 SOC 代表了一种现代化安全运营模式——超越传统自动化,构建由自主 AI 智能体驱动的系统。这些智能体能够独立推理、决策并执行复杂的安全任务,同时保持人类分析师的全程掌控。
Google 安全 AI 框架(SAIF)
Google 安全 AI 框架(SAIF) 为 AI 系统提供了全面的安全指导。
延伸资源: - Google 的安全 AI 智能体方法
AI 智能体安全风险与原则
已识别的关键风险: - 风险 1:越权行为 — 智能体执行未经授权或有害的操作 - 风险 2:敏感数据泄露 — 无意中暴露机密信息
安全原则: - 原则 1:智能体必须有明确定义的人类控制者 - 原则 2:智能体的权限必须受到限制 - 原则 3:智能体的行为与规划必须可观测
三层防御体系
Google 的安全方案实现了三个相互补充的防御层次:
1. 策略定义与系统指令(智能体的"宪法")
首先定义智能体期望与非期望行为的策略,并将其工程化为系统指令(SI),作为智能体的核心行为准则。
2. 护栏、防护措施与过滤(执行层)
该层作为硬性执行机制:
- 输入过滤:使用分类器及 Perspective API 等服务分析提示词,在恶意输入到达智能体前予以拦截
- 输出过滤:Vertex AI 内置安全过滤器对有害内容、个人身份信息(PII)或违规内容进行最终审查
- 人在回路(HITL)升级:对于高风险或模糊操作,系统必须暂停并上报人工审核
3. 监控与响应
持续监控智能体行为,并对检测到的异常情况具备自动化响应能力。
SAIF 框架实施
Google 安全 AI 框架:https://saif.google/
交互式实施地图:https://saif.google/secure-ai-framework/saif-map
SAIF 框架组件: - 安全基础:建立安全的基础设施与开发实践 - 安全开发:在 AI 开发生命周期全程落实安全措施 - 安全部署:确保部署与运营实践符合安全要求 - 安全运营:通过持续运营与监控维持安全态势
AWS 视角
生成式 AI 安全范围矩阵
AWS 推出了 生成式 AI 安全范围矩阵,帮助各组织理解并应对基础模型(FM)应用的独特安全挑战。
AI 安全范围矩阵是一个综合框架,旨在帮助组织在 AI 全生命周期内评估并实施安全控制措施,将安全考量细分为具体类别,以便有针对性地保护 AI 应用。
核心特性: - 全生命周期覆盖:从开发到部署的安全考量 - 风险分类:识别和应对风险的结构化方法 - 控制映射:针对不同 AI 应用类型的专项安全控制 - 合规对齐:框架与监管要求的一致性
实施领域: - 数据安全:保护训练数据及模型输入/输出 - 模型安全:保护 AI 模型本身 - 基础设施安全:保护底层计算与存储基础设施 - 应用安全:保护使用 AI 模型的应用程序 - 运营安全:持续的安全监控与事件响应
实施最佳实践
面向开发团队
- 实施纵深防御:参照 Google 方案采用多层安全防护
- 遵循 NIST AI RMF:采用结构化的风险管理实践
- 使用厂商框架:充分利用云厂商的安全工具与框架
- 持续监控:实施持续的安全监控与告警机制
面向企业级组织
- 采纳综合框架:实施 NIST AI RMF 或同类综合框架
- 厂商专项安全:利用云厂商安全服务(Google SAIF、AWS 安全矩阵)
- 人工监督:对关键决策保持人在回路的管控
- 定期评估:定期开展安全评估与渗透测试
面向合规与治理
- 风险文档化:维护全面的风险登记册与缓解计划
- 策略制定:制定清晰的 AI 治理策略与流程
- 利益相关方参与:确保跨职能部门共同参与 AI 安全工作
- 监管对齐:将安全实践与相关监管要求保持一致
各应用场景的安全考量
高风险应用
- 金融服务与交易系统
- 医疗健康与医学诊断
- 关键基础设施控制
- 自动驾驶系统
附加控制措施: - 强化人工监督要求 - 更严格的访问控制与身份验证 - 实时监控与告警 - 完整的审计跟踪
中等风险应用
- 客户服务与支持
- 内容生成与营销
- 业务流程自动化
- 数据分析与报告
标准控制措施: - 定期安全评估 - 标准访问控制 - 监控与日志记录 - 事件响应流程
低风险应用
- 内部生产力工具
- 研究与开发
- 非关键自动化
- 教育类应用
基础控制措施: - 基础访问控制 - 标准监控 - 定期更新与补丁 - 用户培训与安全意识
新兴安全挑战
AI 特有威胁
- 提示词注入:旨在操控 AI 行为的恶意输入
- 模型投毒:针对训练数据或模型参数的攻击
- 数据提取:尝试窃取敏感训练数据
- 对抗样本:专门设计以导致错误分类的输入
缓解策略
- 输入验证:对 AI 系统的所有输入进行全面验证
- 输出过滤:对 AI 生成的输出进行过滤与验证
- 模型监控:持续监控模型行为与性能
- 安全训练:采用安全的模型训练与数据处理实践
上述安全框架为构建可信、安全、合规的智能体 AI 系统奠定了基础,使其能够在生产环境中安全运行,同时保留 AI 智能体的灵活性与核心价值。
Microsoft 视角
Agent Governance Toolkit
Microsoft 的 Agent Governance Toolkit(AGT) 采用中间件层方法实现运行时治理——在每个智能体动作执行前,对其施加确定性策略执行、零信任身份认证与执行沙箱隔离。主要特点:
- 策略引擎:支持 YAML / OPA Rego / Cedar 规则,p50 延迟仅 0.012 ms;故障关闭设计确保策略违规通过率为 0.00%
- 零信任身份:Ed25519 + 量子安全的 ML-DSA-65 凭证;行为信任评分(0–1000),异常行为时自动衰减;兼容 SPIFFE/SVID
- 执行环:四个硬件启发式权限级别;Saga 编排与自动补偿;集群级熔断开关
- MCP 安全网关:工具投毒检测、描述漂移监控、针对 Model Context Protocol 工具的域名抢注检查
- 智能体 SRE:SLO、错误预算、熔断器、回放调试、OpenTelemetry 原生治理事件
- 合规性:Merkle 链式审计日志、Decision BOM、EU AI Act / SOC 2 / HIPAA / GDPR 自动化合规证据
- OWASP 覆盖:覆盖全部 10 项 OWASP Agentic Top 10 风险;在 10 项正式规范中累计 13,000+ 测试
- 适配器:支持 20+ 框架(LangChain、AutoGen、CrewAI、Semantic Kernel、Google ADK、OpenAI Agents SDK 等);提供 Python、TypeScript、.NET、Rust、Go SDK
Anthropic 视角
Anthropic Sandbox Runtime
Anthropic 的 Sandbox Runtime(srt) 是一款轻量级操作系统级沙箱工具,无需容器即可对任意进程施加文件系统与网络限制。其主要用途是将 MCP 服务器封装在最小权限执行环境中:
- 文件系统隔离:拒绝后允许策略,仅开放显式路径白名单
- 网络隔离:通过 HTTP/SOCKS5 代理实现仅允许模式,屏蔽所有未列入白名单的域名
- OS 原生机制:macOS Seatbelt(
sandbox-exec)与 Linuxbubblewrap——开销低于 Docker - 违规监控:实时违规告警,支持取证与可观测性集成
安装方式:npm install -g @anthropic-ai/sandbox-runtime(Apache-2.0 协议,约 4.1k stars)
智能体沙箱——跨厂商概览
如需全面比较云托管与本地沙箱方案(E2B、Daytona、Modal、Firecracker、gVisor、Kata Containers、nsjail 等),请参阅 智能体沙箱 参考页。
CSA 视角
智能体 AI 红队演练指南
云安全联盟(CSA) AI 组织责任工作组发布了 智能体 AI 红队演练指南(2025 年 8 月),定义了专门针对自主、多步骤、工具调用型智能体的实践测试方法论——有别于单轮 LLM 红队演练。
12 个威胁类别:智能体授权与控制劫持、监督者脱离回路、智能体关键系统交互、智能体目标与指令操控、智能体幻觉利用、智能体影响链与爆炸半径、智能体知识库投毒、智能体记忆与上下文操控、智能体编排与多智能体利用、智能体资源与服务耗尽、智能体供应链与依赖攻击,以及智能体不可追踪性。
四阶段测试方法论:准备 → 执行 → 分析 → 报告,并配套互补的威胁建模框架(MAESTRO)。
详见 智能体 AI 红队演练指南(CSA),获取完整威胁分类、可操作测试步骤及工具全景(AgentDojo、Agent-SafetyBench、SplxAI Agentic Radar、Azure AI Red Teaming Agent 等)。
AI 智能体技能安全扫描器
随着智能体技能(SKILLS.md / .claude/commands/*.md)成为智能体工作流的主要分发单元,扫描其中潜藏的威胁已成为一门独立的安全专项。研究显示,26.1% 的技能存在漏洞,5.2% 显示出明显的恶意意图。
以下两款开源工具专门应对技能供应链安全问题:
| 工具 | 厂商 | 核心优势 |
|---|---|---|
| Skill Scanner | Cisco AI Defense | 多引擎共识(YARA + AST + LLM + VirusTotal);交互式 HTML 报告;SARIF/GitHub Actions 集成 |
| SkillSpector | NVIDIA | 涵盖 16 个类别的 64 种检测模式;实时 OSV.dev CVE 查询;MCP 专项风险检测;LangGraph 流水线 |
详见 AI 智能体技能安全扫描器,获取完整介绍、CLI 用法与威胁模型对比。
教育资源
Learn Prompt Hacking
Learn Prompt Hacking(TrustAI-laboratory)是一个开源、课程式资源库,涵盖 ChatGPT 越狱、针对 GPT Assistants/自定义 GPT 的提示词注入,以及 LLM 应用的红队/蓝队防御技术——它是智能体红队演练的单轮前置学科。
参见
- 智能体开发框架:框架的安全考量
- 智能体平台:平台安全特性
- 标准:安全标准与协议
- 最佳实践:安全最佳实践
- Agent Governance Toolkit:Microsoft 智能体运行时治理
- Anthropic Sandbox Runtime:面向 MCP 服务器的操作系统级进程沙箱
- 智能体沙箱:跨厂商沙箱方案对比
- AI 智能体技能安全扫描器:Cisco Skill Scanner 与 NVIDIA SkillSpector——扫描智能体技能中的提示词注入、数据泄露与恶意模式
- MCP 标准:Model Context Protocol(MCP 安全网关目标)
- AI 治理方案:治理平台与工具
- 智能体 AI 红队演练指南(CSA):面向自主智能体的 12 类威胁分类与四阶段测试方法论
- 云安全联盟(CSA):行业标准机构——智能体 AI 红队演练指南、MAESTRO 威胁建模
- Learn Prompt Hacking:开源越狱/提示词注入课程,涵盖进攻技术与红队/蓝队防御






