跳转至

智能体 AI 知识库

Agentic AI

一个全面、结构化的知识仓库,汇集了构建、部署与大规模运营智能体 AI(Agentic AI)系统所需的前沿研究、模式、框架与最佳实践。

总览

智能体 AI 知识库是一个集中式的知识中枢,旨在支撑智能体 AI 开发的完整生命周期——从基础概念、架构模式,到生产部署、安全与运营卓越。本仓库汇聚了精选知识文章、架构模式、白皮书、研究洞见与行业最佳实践,覆盖整个智能体 AI 生态。

我们以完整的知识库结构系统化地覆盖智能体 AI 的方方面面,帮助架构师、工程师、研究者与平台团队设计出健壮、安全、可投入生产的智能体 AI 方案。知识库涵盖的核心主题包括:智能体架构与框架、技术栈、行业标准、评测方法论、安全框架以及运营最佳实践。

知识库结构

1. 引言

  • 概览:知识库的欢迎与基础介绍
  • 免责声明与使用指南:重要的使用说明与免责声明
  • 目标读者:从事智能体 AI 工作的架构师、工程师、研究者与平台团队

2. 智能体运行框架(Harness)

  • 智能体运行框架:什么是运行框架及其核心组件(系统提示词、工具、沙箱、编排、hooks);模型–运行框架协同进化循环
  • 运行框架工程:前馈/反馈控制、计算型与推断型传感器、调控类别(可维护性、架构适配度、行为)、可运行框架化(harnessability)因素
  • 代码即智能体运行框架:一篇涵盖 197 篇论文的综述(Ning et al., 2026),论证代码是智能体系统可执行、可检视、有状态的基底;三层分类法:运行框架接口(推理/行动/环境建模)、运行框架机制(规划/记忆/工具调用/迭代调试)与运行框架扩展(围绕共享代码产物的多智能体协同);应用领域横跨编码助手、GUI/OS 智能体、科学发现、具身机器人、DevOps 与企业工作流
  • 运行框架优化:使用具备文件系统访问能力、可读取历史执行轨迹的智能体式提议器,对运行框架代码进行自动化搜索(Meta-Harness,Lee et al., 2026);在文本分类上 +7.7 分(token 用量减少至 1/4),在 IMO 数学推理上跨 5 个留出模型 +4.7 分,在 TerminalBench-2 上超越手工调优基线
  • 循环工程(Loop Engineering):设计有计划、自我喂养的系统,让系统主动提示智能体,而非由人来提示——六大原语(自动化、worktree、技能、连接器、子智能体、外置状态),并在 Codex 应用与 Claude Code 上一一映射;随着循环不断改进,验证、理解力腐化(comprehension rot)与认知让渡(cognitive surrender)仍是未解难题
  • LLM 运行框架综述与分类法:ETCLOVG 七层分类法(执行、工具、上下文、生命周期、可观测性、验证、治理);形式化 H=(E,T,C,S,L,V) 模型;覆盖 23+ 系统的运行框架完备性矩阵;九项基于实证的技术挑战;涵盖 110+ 篇论文及 1997–2026 年的时间线

3. 核心概念

  • 智能体定义:智能体 AI 系统的基础定义与术语;Chat-Engine 与 Do-Engine 之辨(You.com, 2026);AI Engineering 的智能体定义(Huyen, 2025)——智能体感知其环境并借助工具对环境施加行动,以基础模型作为规划「大脑」
  • 智能体类型:不同智能体架构的分类与对比
  • AI Engineering:在基础模型之上构建应用的学科——提示词工程、RAG、微调与智能体这四大核心适配技术;AI 工程技术栈(基础设施层、模型层、应用层);AI 工程与 ML 工程之对比(Huyen, O'Reilly 2025)
  • 参考文献:关键研究论文与基础资料
  • 2026 年 AI 预测(You.com):Richard Socher 与 Bryan McCann 的 35 条预测,涵盖劳动力转型、奖励工程、十人独角兽、软件开发、垂直 AI 智能体、太空计算、生物科技与消费媒体

4. 架构与设计模式

  • 智能体架构组件:系统组件的选型标准
  • 设计模式选型:成熟模式,包括 OpenAI 的智能体模式、Arsanjani & Bustos 模式目录(Agent Router、Supervisor、Swarm、Blackboard、FCoT、指令保真审计、自适应重试、金丝雀智能体测试等 20+ 模式),以及 Confluent 在 Kafka/Flink 之上对编排者-工作者、层级式、黑板、市场化等模式的事件驱动实现
  • 多智能体系统:四种架构(中心化、去中心化、层级式、混合式);Supervisor 与 Swarm 对比;Agent Router 模式;七大收益;失效模式与决策框架;面向架构选型的框架对比;以事件驱动(Kafka 消费者组)实现编排者-工作者、层级式、黑板与市场化协同
  • 12-Factor 智能体:构建可靠 LLM 应用的原则
  • Gartner LLM 模式:业界公认的设计模式

5. 智能体开发框架

全面覆盖主流开发框架: - LangChain 与 LangGraph:拥有 100 万+ 开发者的业界标准框架;LangGraph 擅长复杂的有状态多智能体工作流 - Google ADK:与模型无关、针对 Google Cloud 优化的框架;支持层级式智能体组合与内置评测 - AWS Strands Agents:模型驱动的自主智能体框架,原生支持 MCP 与 A2A - Microsoft Agent Framework:统一的 .NET 与 Python 框架 - AutoGen:Microsoft 推出的多智能体对话框架 - Semantic Kernel:面向企业级应用、可投入生产的 SDK - LlamaIndex:面向数据密集型 LLM 应用与知识管理;Parse Gateway 根据每页复杂度(LiteParse is_complex)将 PDF 页面路由到能够处理它的最低成本解析层级,避免整份文档统一使用高级解析 - AutoGPT:用于工作流自动化的持续运行 AI 智能体 - CrewAI:基于角色的多智能体协作框架;配置极简 - Agno:高性能多智能体框架(智能体创建约 2μs,每个智能体约 3.75 KiB) - Mastra:TypeScript 优先的框架,面向 Web 应用并可与既有 REST API 集成 - PydanticAI:类型安全的生成式 AI 开发 - Spring AI:与 Java 生态集成 - Haystack:可投入生产的 LLM 应用与 RAG 流水线 - AI 编码智能体:Claude Code、OpenAI Codex、Kiro(AWS 用于替代 Amazon Q Developer 的全新产品)、Cursor、Devin、GitHub Copilot 等;Google Antigravity(CLI/2.0/SDK/IDE)接替 Gemini CLI(Free/Pro/Ultra 层级于 2026 年 6 月停止服务);Snowflake CoCo(原 Cortex Code)和 Databricks Genie Code 将数据原生与湖仓原生编码智能体纳入对比 - FreePHDLabor:基于 smolagents 的开源多智能体框架,通过 ManagerAgent 编排 Ideation、Experimentation、Writeup、Reviewer 和 Proofreading 智能体,自动化完成科学研究全流程

6. 智能体技术栈

  • 技术栈参考资料:全面的技术全景概览
  • 语义数据层技术雷达:Thoughtworks 风格的雷达,对比云原生语义层(Snowflake Semantic Views、Databricks Metric Views、Power BI/Fabric 语义模型、AWS QuickSight Topics、Google Looker/LookML)与通用语义层及指标库(dbt Semantic Layer、Cube、AtScale、Denodo、Honeydew、Bright Analytics),以及新兴的 Open Semantic Interchange(OSI)标准
  • 智能体 AI 平台:Google Gemini 企业级智能体平台(2026 年 4 月 22 日在 Cloud Next '26 GA,Vertex AI 的继任者并吸收 Agentspace)、AWS AgentCore、Microsoft Azure AI、Databricks Genie(Genie One、Genie Agents/原 Genie Spaces、Genie Code、Genie App Builder、Genie ZeroOps、Genie Ontology);企业级平台对比(2026),涵盖 Salesforce Agentforce、Microsoft Copilot Studio、ServiceNow、Kore.ai、UiPath Maestro、Azure AI Foundry Agent Service、IBM watsonx Orchestrate、LangGraph 与 CrewAI Enterprise,附定价、采用数据与中肯的约束分析
  • 工作流引擎:开源、自托管与 SaaS 方案;Temporal 用于持久化执行——容错、长时运行的 AI 智能体工作流,支持事件历史重放、用于人在回路的 Signals,以及用于多智能体扇出的子工作流;Confluent(Apache Kafka 与 Flink)作为事件流主干,支撑高扇出的多智能体协同、智能体式 RAG 数据摄取与实时流处理;Kestra(Apache 2.0)作为声明式、YAML 优先的编排平台,在其 1.0 LTS 版本中新增了原生 AI Agent 任务、记忆/工具以及 MCP 服务器/客户端
  • 热门 AI 智能体:编码智能体、研究智能体与超级智能体;个人 AI 智能体新增 LifeOS(Daniel Miessler 基于 Claude Code 技能构建、与运行框架无关的个人操作系统)和 OpenWorker(Andrew Ng 的开源、本地优先桌面 AI 协作者,返回完成的交付物);Discovery Loop(Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 创办的大规模并行自动化 ML 研究 PBC);Dosu(负责议题分类和文档维护的 AI GitHub/GitLab 维护者智能体);MindStudio(可访问 200+ 模型的无代码 AI 智能体构建器)

7. 智能体 AI 行业标准

  • 智能体 AI 基金会:Linux 基金会推动开放标准的倡议
  • 模型上下文协议(MCP):Anthropic 提出的 LLM 上下文标准化方案
  • Agent2Agent(A2A)协议:Google 的智能体互操作标准
  • AGENTS.md:AI 智能体指令的行业标准
  • OpenSpec 与 AG-UI:面向开发与界面的新兴标准
  • AIDLC 工作流(AWS):方法论优先的 AI 驱动开发生命周期,包含结构化的 Inception → Construction 阶段、审批门控,以及用于 CI/CD 质量门的内置评测器
  • 开放知识格式(OKF):Google Cloud 的开放规范(v0.1,2026 年 6 月),用于可移植、对智能体与人类皆可读的知识包——带 YAML frontmatter 的 markdown 文件,无需 SDK 或运行时;将 Karpathy 的「LLM-wiki」模式正式化
  • 云安全联盟(CSA):智能体 AI 测试与治理的行业标准机构——《智能体 AI 红队演练指南》(12 类威胁分类法)与 MAESTRO 威胁建模框架
  • Agent Client Protocol(ACP):Zed Industries 的开放标准(基于 stdio 的 JSON-RPC),用于编辑器与智能体集成——涵盖会话生命周期、工具调用上报与权限请求;Gemini CLI 原生采用,并通过 JetBrains 的 ACP Agent Registry 推广,Claude Code 与 Codex CLI 通过适配器支持
  • Kubernetes Agent Sandbox:Kubernetes SIG Apps 子项目(2025 年 11 月 KubeCon Atlanta 发布),通过 Sandbox/SandboxTemplate/SandboxClaim CRD 为单次智能体工具调用标准化隔离执行环境,并以 WarmPools 实现亚秒级冷启动;GKE 产品化现已 GA,另有 Agent Substrate——一个面向超大规模、亚秒级工具调用智能体集群的全新最小控制平面开源项目

8. 智能体 AI 参考架构

  • AI 自动化:LangManus 框架与自动化模式
  • 自学习智能体:Agent0 系列与自进化系统
  • AI 助手架构:参考实现与蓝图
  • RAG 架构:检索增强生成模式
  • 搜索即代码(SaC):Perplexity 的范式,由模型生成代码来组装面向特定任务的检索流水线;三层结构——模型作为控制平面、计算沙箱、智能体式搜索 SDK;在 WANDR 基准上取得 2.5× 优势;在 CVE 审计案例中 token 用量减少 85.1%
  • NVIDIA AI Blueprints:视频检索与摘要智能体

9. 智能体 AI 成熟度模型

  • Gartner 视角:行业成熟度评估框架
  • AWS 视角:生成式 AI 成熟度模型与演进路径
  • Google 视角:云原生成熟度考量
  • IDC 视角:市场演进与采用模式
  • Arsanjani 生成式 AI 成熟度模型:7 级框架(数据基础 → RAG → 调优 → 接地 → 单智能体 → 多智能体),含智能体解剖、全新的智能体技术栈(函数调用、MCP、A2A)以及成熟度与模式的映射

10. 智能体应用市场

  • AWS AI 智能体市场:企业级智能体方案与平台
  • AgentOps 市场:运营工具与服务
  • 其它平台:社区与专项应用市场

11. AI 智能体最佳实践

  • Anthropic:构建高效智能体与安全考量
  • Google:企业级部署与扩展最佳实践
  • Microsoft:.NET 与 Azure 集成模式
  • OpenAI:构建智能体的实用指南与智能体模式

生产环境最佳实践与指南

专门的章节,汇总所有生产就绪指南——面向将智能体从原型推向生产的团队的横切关注点。

可观测性

  • 目标与定位:监控、调试与性能优化
  • 可观测性方案:LangSmith、Langfuse、Openlit、Braintrust、W&B Weave、Galileo(Graph/Trace/Timeline 视图、Insights Engine)
  • 最佳实践:分布式链路追踪、告警、仪表盘与预测式可观测性;三级追踪(会话/步骤/系统);生产基准(动作完成度、工具选择质量)

状态与记忆管理

  • 三个功能层级:短期、情景与长期记忆系统;AWS 时长 × 范围分类法(上下文内 / 会话 / 跨智能体 / 语义)
  • 上下文窗口 Token 预算:KV cache 命中率优化、窗口策略(最近 k 轮、Token 预算、语义、渐进式摘要)与 LangGraph checkpointer 模式
  • 长期记忆(LTM)策略:向量 RAG(HNSW 与 IVF+PQ 选型指南)、混合 BM25+稠密检索+RRF+重排序流水线(端到端约 62ms)、知识图谱、面向结构化依赖查询的 GraphRAG、AgentCore Memory 提取层级,以及 Redis/MongoDB 冷热交接模式
  • 记忆治理:数据血缘(CloudTrail)、分层留存策略(24 小时会话 → 90 天工作流 → 7 年归档)、PII 检测(Bedrock Guardrails + Macie)与删除权(GDPR/CCPA)实现模式
  • 记忆方案:Mem0、MemMachine、Zep、AgentFS、云托管记忆服务(AWS AgentCore、Vertex、Azure、Anthropic Managed Agents、Salesforce Agentic Memory、Cloudflare Agent Memory)、agentmemory、MinnsDB,以及框架原生记忆(LangGraph、LlamaIndex、CrewAI)——完整技术雷达对比

部署

  • AgentOps 与 GenOps:面向生成式 AI 系统的 MLOps 演进
  • 生命周期管理:开发、测试、部署与运营;OpenGeni(Apache-2.0)是一个可自托管的智能体运行时,提供持久化、可重放会话、人工审批以及受治理的凭证/记忆
  • 生产运营:容器编排、自动扩缩容与多智能体协同
  • Kubernetes 原生智能体编排:kagent(CNCF Sandbox)、Agentic Ops Framework(AOF)与 KAOS 把智能体、工具与模型作为 Kubernetes 自定义资源运行;独立的 Kubernetes SIG Apps "Agent Sandbox" 子项目则为单次智能体工具调用标准化隔离执行环境

智能体测试与评测

  • LLM 评测框架:DeepEval、MLFlow、RAGAS 与 OpenEvals
  • AI 充当评审:用基础模型评测其他 AI 的输出——三种用法(绝对打分、参照对比、成对比较)、AI 评审的提示词设计、局限(不一致、长度偏置、位置偏置),以及评审模型选型指南(Huyen, 2025;Zheng et al., 2023——在 MT-Bench 上 GPT-4 与人类一致率达 85%)
  • 智能体基准:METR、Terminal Bench、VisualWebArena、GAIA 与 DeepResearch Bench(对深度研究智能体的 RACE/FACT 评测);Terminal-Bench 2.0/2.1 现通过开源的 Harbor 评测运行框架运行
  • 评测平台:Galileo、Google Stax、LastMile AI、Harbor(分布式基准/RL-rollout 运行框架)、AWS Agent-EvalKit、Google LLM EvalKit(基于 Vertex AI 的开源无代码提示词工程与评测中心)、AWS Bedrock Evaluations(托管式模型/RAG/人工评测,2025 年 3 月 GA),以及 Azure AI Foundry Evaluation(质量 + 风险/安全评测器)
  • 评测技术雷达:对开源评测框架(DeepEval、RAGAS、MLFlow)与托管平台(Galileo、LangSmith、Bedrock Evaluations、Foundry Evaluation)进行 Adopt/Trial/Assess/Hold 分类

上下文工程

  • 关键挑战:上下文腐化、投毒、分心、混淆与冲突——附 DeepMind、Gemini 2.5、Berkeley、Microsoft/Salesforce 研究的实证证据
  • 记忆与上下文之辨:100:1 法则;哪些该留在上下文、哪些该存入记忆;四类上下文
  • 管理策略:卸载、削减、检索、隔离与缓存;上下文大小阈值;分阶段实施路线图
  • 效率前沿:感知部署的成本-性能优化;以复用参数(N)驱动策略选型;约 25% 的 token 节省;检索与压缩之间的转换边界(Shen et al., 2026)
  • 实现参考:Manus、Anthropic、LangGraph 与 Devin 的做法

智能体安全

  • 安全标准:NIST AI 风险管理框架
  • Google 视角:SAIF 框架与安全 AI 智能体方法
  • AWS 视角:生成式 AI 安全范围界定矩阵
  • Microsoft 视角:智能体治理工具包——运行时治理,支持确定性策略执行(YAML/OPA/Cedar)、零信任身份、执行沙箱、MCP 安全网关;覆盖全部 10 项 OWASP Agentic Top 10 风险
  • CSA 视角:《智能体 AI 红队演练指南》——12 类对抗测试分类法(授权劫持、检查者脱离回路、幻觉利用、爆炸半径、知识库投毒、多智能体利用等),并配套准备/执行/分析/报告四阶段方法论
  • 风险管理:失控行为、数据泄露、提示词注入及缓解策略
  • 智能体沙箱:跨操作系统级策略、容器、microVM 与云托管各层的隔离分类法——E2B、Daytona、Modal、LangSmith Sandboxes、AWS Lambda MicroVMs、Firecracker、gVisor、Kata Containers、Anthropic srt 与 nsjail
  • 提示词攻击教育:Learn Prompt Hacking——涵盖越狱、针对 GPT Assistants/自定义 GPT 的提示词注入,以及 LLM 红队/蓝队防御的开源课程

成本管理

  • Token 优化:模型路由、提示词优化与缓存策略
  • 预算控制:单请求预算、告警阈值与硬性熔断
  • 成本监控:Langfuse、Openlit、LangSmith、Braintrust 成本追踪
  • 厂商指南:Anthropic、OpenAI、Google 与 AWS 的成本优化方法

目标读者

架构师与技术负责人

  • 设计智能体 AI 方案的系统架构师
  • 评估框架与平台的技术负责人
  • 规划 AI 转型计划的企业架构师

软件工程师与开发者

  • 构建智能体应用与工作流的开发者
  • 将 AI 智能体集成进既有系统的工程师
  • 从事 AI 驱动应用的全栈开发者

AI/ML 工程师与研究者

  • 实现基于智能体系统的 ML 工程师
  • 探索多智能体架构的 AI 研究者
  • 构建智能自动化方案的数据科学家

平台与 DevOps 团队

  • 部署智能体基础设施的平台工程师
  • 管理 AI 智能体生命周期的 DevOps 团队
  • 监控智能体系统的 SRE

产品与业务团队

  • 定义智能体能力的产品经理
  • 评估 AI 智能体投资回报的业务分析师
  • 探索智能体 AI 机会的创新团队

学习路径

入门路径:打基础

  1. 从这里开始:引言 → 核心概念 → 架构模式
  2. 选择框架:智能体开发框架(建议从 LangChain/LangGraph 入手)
  3. 构建第一个智能体:技术栈 → 参考架构
  4. 了解标准:行业标准 → 最佳实践

进阶路径:动手实现

  1. 深入框架:针对你的场景对比多个框架
  2. 架构设计:参考架构 → 上下文工程
  3. 记忆与状态:状态与记忆管理 → 智能体测试与评测
  4. 生产就绪:智能体安全 → 可观测性 → 部署

高阶路径:生产与规模化

  1. 企业级模式:成熟度模型 → 智能体安全 → 成本管理
  2. 运营卓越:部署 → 可观测性 → 智能体测试与评测
  3. 市场与生态:智能体应用市场 → 行业标准
  4. 创新与研究:最新研究论文与新兴模式

专项路径

安全方向:智能体安全 → 智能体测试与评测 → 标准 → 可观测性

研究方向:核心概念 → 参考架构 → 智能体测试与评测 → 状态与记忆管理

平台工程方向:技术栈 → 部署 → 可观测性 → 成本管理 → 应用市场

核心特性

  • 全面覆盖:以结构化章节覆盖整个智能体 AI 全景
  • 框架对比:对 14+ 主流开发框架的详细分析
  • 聚焦生产:专门的生产环境最佳实践章节,涵盖安全、可观测性、成本、部署与测试
  • 行业标准:覆盖 MCP、A2A、AGENTS.md 等新兴标准
  • 可视化文档:60+ 张图表与架构参考,命名清晰
  • 研究整合:最新学术研究与行业白皮书
  • 多厂商视角:多云、与厂商无关的中立立场
  • 社区驱动:开源,采用 Apache 2.0 许可

快速开始

快速上手

  1. 浏览结构:浏览 16 个章节的导航,了解整体范围
  2. 选择路径:根据你的角色与经验选择一条学习路径
  3. 从概念入手:若初次接触智能体 AI,请从基础概念开始
  4. 挑选框架:选择契合你技术栈的开发框架

面向开发者

  • 智能体开发框架开始,确定你的开发方式
  • 查阅参考架构了解实现模式
  • 探索技术栈,做出平台与工具选型

面向架构师

  • 架构与设计模式入手进行系统设计
  • 查阅生产环境最佳实践与指南(安全、可观测性、成本管理)了解生产考量
  • 研读成熟度模型进行组织就绪度评估

面向研究者

  • 深入核心概念参考架构夯实理论基础
  • 探索评测框架与基准
  • 查阅记忆管理上下文工程等进阶主题

参与贡献

我们欢迎社区的贡献!本知识库被设计为一份「活」的资源,将随着智能体 AI 这一快速演进的领域持续更新。

如何贡献

  • 内容更新:为新研究、框架或最佳实践提交 pull request
  • 框架评析:补充对新增或更新框架的分析
  • 案例研究:分享真实落地经验与经验教训
  • 文档完善:提升既有内容的清晰度与准确性

贡献准则

  • 遵循既定的 16 章节结构
  • 包含恰当的引用与参考
  • 尽可能保持厂商中立视角
  • 添加文件名清晰、有意义的可视化图表

免责声明

本知识库包含的图片、图表与可视化参考,部分来源或改编自外部文章、研究论文、厂商文档及公开材料。所有此类视觉内容的版权归各自所有者所有,仅用于教育、参考与示意目的。在适用情形下均已注明或引用原始来源,且不对任何第三方内容主张所有权。

许可证

本项目采用 Apache License 2.0 许可。

致谢

本知识库建立在开源社区、学术研究者与行业从业者卓越工作的基础之上,正是他们持续推动着智能体 AI 领域的进步。特别感谢所有贡献者,以及公开分享研究与洞见的各个组织。