Learn Prompt Hacking
概述
Learn Prompt Hacking(TrustAI-laboratory)是一个开源教育资源库,帮助开发者、数据科学家和安全专业人员深入理解提示词工程技术,以及 LLM 应用面临的对抗性提示词风险。它将 2023 年视为通用 LLM 大规模普及的转折点,并将随之出现的安全暴露面视为一门值得系统学习的独立学科,而不是一些零散技巧。
核心概念/范围
该仓库将内容组织为进攻和防御两条路径:
进攻技术(攻击向量):
- ChatGPT 越狱与绕过安全训练
- 针对 GPT Assistants 和自定义 GPT 的提示词注入攻击
- 通用 LLM 提示词漏洞
- 应用于语言模型的对抗性机器学习技术
防御技术:
- LLM 应用的蓝队防御策略
- 推理增强与安全加固技术
- 用于测试模型和应用鲁棒性的评测基准
内容结构
材料按模块组织,包括:基础知识(核心概念)、应用(实际实现)、进攻技术(提示词攻击方法)、红队练习(攻击模拟)、蓝队防御(缓解策略)、评测框架,以及会议演讲和学术论文合集。
适用对象
- 希望以实用、结构化方式理解如何有效使用 LLM,以及这些机制如何被滥用的数据科学家和 AI 开发者。
- 希望建立 LLM 与智能体应用红队或蓝队能力的安全专业人员。
与智能体 AI 安全的关系
该仓库整理的技术(越狱、提示词注入、对抗性提示)是多步骤、工具调用攻击面的单轮 LLM 前身;后者由 CSA 智能体 AI 红队演练指南 等方法覆盖。例如,这里的提示词注入可直接映射到该指南的“智能体目标与指令操纵”(4.4)威胁类别;越狱/绕过技术则支撑“智能体幻觉利用”(4.5)及其他失效模式——当攻击目标从单次聊天转变为智能体时尤其如此。
最佳实践
| 挑战/领域 | 说明 | 解决方案/建议 |
|---|---|---|
| 提示词注入 | 攻击者控制的输入覆盖系统指令 | 权限分离、输入/输出过滤、提示词加固——参见提示词工程——提示词注入防御 |
| 越狱 | 精心构造的提示词绕过安全训练 | 基于模型的分类器、推理增强,以及针对已知越狱语料库的持续红队评测 |
| 自定义 GPT / Assistant 暴露 | 第三方 GPT 和 Assistants 继承提示词注入与系统提示词窃取风险 | 将自定义 GPT 配置视为系统提示词:不要嵌入密钥,监控提示词提取尝试 |
| 进攻与防御之间的技能鸿沟 | 团队经常只学习防御实践,却缺少对攻击技术的实操经验 | 参照该仓库课程结构开展结构化红队/蓝队演练 |
参见
- 智能体 AI 红队演练指南(CSA) — 将单轮提示词攻击分类扩展到多步骤、工具调用的智能体系统
- 提示词工程 — 防御性提示词工程、提示词注入威胁模型和结构化输出缓解措施
- 智能体安全最佳实践 — 生产环境中的提示词注入、最小权限与审计轨迹
- 智能体 AI 安全概览 — NIST AI RMF、Google SAIF、AWS、Microsoft 和 Anthropic 视角