智能体 AI 红队演练指南(CSA)
概述
红队演练是指针对系统模拟真实世界的对抗性攻击,以便在恶意行为者发现之前找出可利用的漏洞。这一概念起源于军事兵棋推演——指定的"红队"扮演对手,与负责防守的"蓝队"对抗,后来被网络安全领域广泛采用,近年来又延伸至 AI 系统,不仅涵盖传统的漏洞利用测试,还包括探测模型和智能体是否会产生有害、偏颇或不安全输出 (背景参见 IBM: What is red teaming?)。
云安全联盟(CSA)智能体 AI 红队演练指南(由 AI 组织责任工作组于 2025 年 8 月发布)将这一实践专门延伸至智能体 AI 系统。传统的 LLM 红队演练聚焦于单轮提示词/响应的安全性;而智能体系统能够跨多个步骤自主规划、推理和执行操作、调用工具、保留记忆,并与其他智能体协同工作——因此红队演练方法必须对整个行动链进行测试,而不仅仅是模型输出。本指南明确将威胁建模排除在外(该部分由 CSA 的 MAESTRO 框架 单独覆盖),专注于测试程序本身。
为何智能体 AI 的红队演练至关重要
智能体 AI 带来了超越单轮 LLM 交互的独特挑战:
- 自主行动 —— 智能体无需逐步经过人工确认即可执行多步计划并调用工具,因此单次被操纵的决策便可能引发连锁性的现实后果。
- 复用现有知识与资源 —— 智能体会调用外部知识库、记忆存储以及其他智能体的输出,使攻击面远超模型本身。
- 涌现性复合风险 —— 错误、幻觉或注入的指令,可能在人工审查结果之前就已通过工具调用链或智能体交接过程逐步扩散。
12 大威胁类别
本指南将详细测试指导组织为 12 大威胁类别。每个类别均定义了测试要求,细分为若干编号子测试,并提供红队成员可执行的具体可操作步骤。
| # | 类别 | 测试内容 |
|---|---|---|
| 4.1 | 智能体授权与控制劫持 | 直接控制劫持、权限提升、角色继承漏洞利用、活动监控/检测盲区、控制与执行的职责分离、审计追踪完整性、最小权限执行情况 |
| 4.2 | 检查者离线(Checker-Out-of-the-Loop) | 阈值突破模拟、检查者/人工介入测试、异常检测与响应、情境感知决策分析、持续监控与反馈循环 |
| 4.3 | 智能体与关键系统交互 | 物理系统操纵、IoT/OT 命令注入、关键基础设施访问、安全联锁绕过、实时异常监控、命令/行动验证 |
| 4.4 | 智能体目标与指令操纵 | 目标解读攻击、指令集投毒、语义操纵、递归/层级目标颠覆、自适应操纵、通过目标偏移实施数据泄露、目标提取尝试 |
| 4.5 | 智能体幻觉利用 | 诱导幻觉测试、跨智能体级联幻觉、通过虚构输出操纵决策、输出验证/校验、异常检测、保护性故障保护机制、领域特定幻觉触发点 |
| 4.6 | 智能体影响链与爆炸半径 | 通过受损智能体跨系统利用漏洞、信任关系滥用、爆炸半径限制、遏制机制、安全屏障有效性验证 |
| 4.7 | 智能体知识库投毒 | 训练数据投毒、外部知识操纵、知识库污染、引导式学习漏洞利用、更新机制脆弱性、跨智能体知识共享、恢复与监控 |
| 4.8 | 智能体记忆与上下文操纵 | 上下文遗忘漏洞利用、跨会话/跨应用数据泄露、记忆投毒、记忆溢出/上下文丢失、安全会话管理 |
| 4.9 | 智能体编排与多智能体漏洞利用 | 智能体间通信漏洞利用、信任关系滥用、协调协议操纵、反馈循环资源耗尽、编排/边界控制、智能体间对抗性串通/欺骗、通过受管智能体响应对编排者状态进行投毒 |
| 4.10 | 智能体资源与服务耗尽 | 计算资源耗尽、内存耗尽、API/服务配额耗尽、学习过程漏洞利用、异常监控、防御架构测试 |
| 4.11 | 智能体供应链与依赖攻击 | 开发链攻陷、依赖注入、服务链攻陷、部署流水线安全、监控/检测能力 |
| 4.12 | 智能体不可追溯性 | 追踪规避模拟、下游工具激活分析、取证分析混淆、问责链核验、含 PII/PCI/PHI 的匿名化压力测试 |
代表性可操作步骤示例
以下为指南测试程序的部分示例,体现了其具体程度:
- 使用 API 测试工具(Postman、Burp Suite)向智能体控制平面注入恶意命令,并观察未经授权的操作是否被接受(4.1)。
- 模拟突破预定义操作阈值(如航空运行限制),测量智能体检测并报告检查者/人在回路(HITL)不可用状态的响应速度(4.2)。
- 使用仿真工具模拟不安全的物理条件(如覆盖温度控制),评估智能体在采取行动前是否记录并上报异常(4.3)。
- 提供刻意模糊或相互矛盾的目标指令,记录智能体如何解决歧义(4.4)。
- 在后续任务中植入前一步骤故意伪造的输出,追踪错误是否会向下游智能体级联蔓延(4.5、4.9)。
- 使用故意受损智能体的凭据尝试访问互联系统,以衡量爆炸半径(4.6)。
- 针对涉及 PII/PCI/PHI 的用例对智能体进行压力测试,确认日志在不泄露敏感数据的前提下保持可读(4.12)。
测试方法论
本指南提出了一种四阶段的智能体 AI 系统红队演练结构化方法:
| 阶段 | 活动内容 |
|---|---|
| 准备 | 定义具体测试场景;搭建受保护/隔离的测试环境;准备工具与脚本 |
| 执行 | 按步骤开展测试;实时记录观察结果;采集日志与指标 |
| 分析 | 评估测试结果;识别漏洞及其潜在影响;按严重程度对发现进行优先级排序 |
| 报告 | 针对每项测试生成详细报告;制定可操作的缓解策略;为相关方汇总发现结果 |
建议的有效性指标(人工与自动化两类): - 检测并阻断未经授权访问尝试的响应时间 - 成功利用漏洞的比例与总尝试次数之比 - 已识别漏洞的遏制时间 - 测试期间未被检测到的恶意行为数量
MAESTRO 与工具生态
本指南将 MAESTRO(CSA 专门为智能体 AI 设计的独立多层威胁建模框架,涵盖评测/可观测性、部署/基础设施、智能体框架以及数据操作)定位为与本测试指南互补的建模层,并列举了一系列新兴红队演练工具与基准测试:
| 工具 / 框架 | 提供方 | 关注点 |
|---|---|---|
| MAESTRO | 云安全联盟 | 面向智能体 AI 的多层威胁建模(非测试):异常/投毒数据集检测、部署/基础设施风险、智能体框架后门、数据操作投毒 |
| AgentDojo | 苏黎世联邦理工学院(SPY Lab) | 通过 97 个真实任务和 629 个安全测试用例对提示词注入攻击/防御进行动态评测;衡量实用性保留与攻击成功率之间的平衡 |
| Agent-SafetyBench | 学术界 | 349 个交互环境,涵盖 8 大风险类别的 2,000 个测试用例;自动评分模型(准确率 91.5%);评测 16+ 个 LLM 智能体 |
| AgentFence | 开源 | 自动探测提示词注入和密钥泄露;预置角色混淆/指令泄露攻击;支持 LangChain 和 OpenAI 智能体的 SDK |
| SplxAI Agentic Radar | SplxAI | 面向 LLM 智能体工作流的安全扫描器:工作流可视化、工具识别(MCP、邮件、JIRA 等)、漏洞映射报告 |
| Agent Security Bench (ASB) | ICLR 2025 | 在 10 个场景中评测 27 种攻击/防御方法;对 13 个 LLM 进行基准测试(最高攻击成功率 84.3%);引入实用性-安全性平衡指标 |
| Promptfoo LLM Security DB | Promptfoo | 面向 LLM 和智能体 AI 的结构化安全漏洞数据库 |
| Pentest Copilot | Bugbase | AI 驱动的红队演练自动化:情境化攻击编排、从威胁情报持续学习、动态对抗行动生成 |
| AI Red Teaming Agent | Microsoft(Azure AI Foundry) | 自动化内容安全风险扫描;攻击成功率(ASR)指标;部署就绪性报告 |
| FuzzAI Framework | Salesforce | 自动化、可扩展的 AI 安全模糊测试:情境特定输入生成(Mutator 模块)、多样本越狱支持、特性专项攻击策略选择 |
未来展望
本指南指出了智能体 AI 红队演练未来发展的优先领域:
- 自主红队演练智能体 —— 实时自适应、自动化漏洞发现与对抗性仿真
- 下游行动红队演练 —— 对智能体行动链进行自动化、多领域测试(超越手动静态/日志分析映射)
- 安全多智能体编排研究 —— 大规模部署中的信任边界、权限分离与智能体间通信安全
- 标准化指标与基准测试 —— 平均检测时间(MTTD)、漏洞利用成功率、遏制时间,并支持跨环境比较
- 与监管框架对齐 —— EU AI Act、NIST AI RMF 及其他围绕问责制和可解释性的新兴要求
- 开源安全工具与研究 —— 社区驱动的仿真框架与攻击场景生成器
参见
- 智能体 AI 安全概述 —— NIST AI RMF、Google SAIF、AWS、Microsoft、Anthropic 视角
- 智能体安全最佳实践 —— 提示词注入、最小权限、审计追踪
- 智能体测试与评测 —— 对抗性测试用例、上线门控
- 云安全联盟(行业标准)
- 智能体沙箱隔离
- Learn Prompt Hacking —— 支撑多个智能体威胁类别的单轮越狱/提示词注入技术
参考资料
- Agentic AI Red Teaming Guide — Cloud Security Alliance, AI Organizational Responsibilities Working Group(2025 年 8 月)——本页主要来源
- HarmBench — 面向自动化红队演练与鲁棒性拒绝的标准化评测框架
- AgentDojo — 评测 LLM 智能体提示词注入攻击与防御的动态环境
- NIST: Strengthening AI Agent Hijacking Evaluations
- AI Organizational Responsibilities: Governance, Risk Management, Compliance, and Cultural Aspects — CSA
- Agentic AI Threat Modeling Framework: MAESTRO — CSA
- Promptfoo LLM Security DB
- Introducing AI Red Teaming Agent — Azure AI Foundry — Microsoft
- SplxAI Agentic Radar
- AI Red Teaming Reasoning LLMs — Adversa AI
- What is red teaming? — IBM,红队演练的起源与通用实践背景