跳转至

Learn Prompt Hacking

概述

Learn Prompt Hacking(TrustAI-laboratory)是一个开源教育资源库,帮助开发者、数据科学家和安全专业人员深入理解提示词工程技术,以及 LLM 应用面临的对抗性提示词风险。它将 2023 年视为通用 LLM 大规模普及的转折点,并将随之出现的安全暴露面视为一门值得系统学习的独立学科,而不是一些零散技巧。

核心概念/范围

该仓库将内容组织为进攻和防御两条路径:

进攻技术(攻击向量)

  • ChatGPT 越狱与绕过安全训练
  • 针对 GPT Assistants 和自定义 GPT 的提示词注入攻击
  • 通用 LLM 提示词漏洞
  • 应用于语言模型的对抗性机器学习技术

防御技术

  • LLM 应用的蓝队防御策略
  • 推理增强与安全加固技术
  • 用于测试模型和应用鲁棒性的评测基准

内容结构

材料按模块组织,包括:基础知识(核心概念)、应用(实际实现)、进攻技术(提示词攻击方法)、红队练习(攻击模拟)、蓝队防御(缓解策略)、评测框架,以及会议演讲和学术论文合集。

适用对象

  • 希望以实用、结构化方式理解如何有效使用 LLM,以及这些机制如何被滥用的数据科学家和 AI 开发者。
  • 希望建立 LLM 与智能体应用红队或蓝队能力的安全专业人员。

与智能体 AI 安全的关系

该仓库整理的技术(越狱、提示词注入、对抗性提示)是多步骤、工具调用攻击面的单轮 LLM 前身;后者由 CSA 智能体 AI 红队演练指南 等方法覆盖。例如,这里的提示词注入可直接映射到该指南的“智能体目标与指令操纵”(4.4)威胁类别;越狱/绕过技术则支撑“智能体幻觉利用”(4.5)及其他失效模式——当攻击目标从单次聊天转变为智能体时尤其如此。

最佳实践

挑战/领域 说明 解决方案/建议
提示词注入 攻击者控制的输入覆盖系统指令 权限分离、输入/输出过滤、提示词加固——参见提示词工程——提示词注入防御
越狱 精心构造的提示词绕过安全训练 基于模型的分类器、推理增强,以及针对已知越狱语料库的持续红队评测
自定义 GPT / Assistant 暴露 第三方 GPT 和 Assistants 继承提示词注入与系统提示词窃取风险 将自定义 GPT 配置视为系统提示词:不要嵌入密钥,监控提示词提取尝试
进攻与防御之间的技能鸿沟 团队经常只学习防御实践,却缺少对攻击技术的实操经验 参照该仓库课程结构开展结构化红队/蓝队演练

参见

参考资料