智能体定义
什么是 AI 智能体?
AI 智能体(Agent)是一种自主软件实体,能够感知所处环境、做出决策并采取行动以实现特定目标。与遵循预定指令的传统软件程序不同,AI 智能体通过以下特质呈现出智能行为:
- 自主性:无需人类持续干预,独立运行
- 反应性:能响应环境中的变化
- 主动性:主动采取行动以实现目标
- 社会性:能与其他智能体及人类进行交互
核心特征
1. 目标导向行为
AI 智能体围绕特定目标而设计,通过一系列决策与行动持续推进,直至目标达成。
2. 环境感知能力
智能体能够感知并理解其运行环境,涵盖数字数据、物理传感器或用户交互等各类形式。
3. 决策能力
借助多种 AI 技术(LLM、机器学习、规则系统),智能体可以对下一步行动做出合理判断。
4. 学习与适应
现代 AI 智能体能从经验中学习,并持续调整自身行为以提升长期表现。
智能体架构组件
典型的 AI 智能体架构包含以下模块: - 感知模块:处理来自环境的输入 - 决策引擎:确定应采取的行动 - 执行模块:在环境中执行决策 - 记忆系统:存储经验与知识 - 学习组件:持续提升整体表现
OpenAI 定义(实践指南,2024)
"智能体是能够代表你独立完成任务的系统。"
OpenAI 面向生产环境的定义,进一步给出了两项具体特征,用以区分真正的智能体与普通 LLM 驱动的应用:
- 由 LLM 控制工作流:智能体使用 LLM 管理执行过程并做出决策。它能识别工作流何时已完成,可主动纠正自身行为,并在发生错误时暂停执行、将控制权交还给用户。
- 在护栏约束下动态选择工具:智能体可访问与外部系统交互的工具(包括数据检索和执行操作),并根据工作流当前状态动态选用合适的工具,始终在预定义的护栏(guardrails)范围内运行。
那些集成了 LLM 但并未让其控制工作流执行的应用——如简单聊天机器人、单轮 LLM 调用、情感分类器——在此定义下不属于智能体。
Chat-Engine 与 Do-Engine(You.com,2026)
You.com 在其 2026 AI 预测白皮书中提出了一种实用框架,明确区分了对话式 AI 与智能体 AI(Agentic AI):
- Chat-Engine(对话引擎):供人类交谈的系统——提供答案、摘要或建议,但所有行动的执行者仍是人类本身。
- Do-Engine(执行引擎):能够端到端自主完成任务的系统——负责规划、选择工具、执行步骤并交付结果,无需人类逐步编排。
这一框架预示着 AI 系统构建方式与价值评估标准将发生根本性转变:Chat-Engine 的效用受制于人类自身的处理带宽,而 Do-Engine 的效用随任务复杂度的提升而扩展。那些集成了 LLM 却未将执行控制权下放的应用,在此定义下仍属 Chat-Engine——预计在 2026 年,Do-Engine 架构将在企业级价值上全面超越前者。
AI Engineering 的智能体定义(Huyen, 2025)
Chip Huyen 的《AI Engineering》(O'Reilly, 2025)从第一性原理给出了一个基础性定义:
"An agent is anything that can perceive its environment and act upon that environment."(智能体是任何能够感知其环境并对该环境施加行动的事物。)
智能体由两个维度刻画: 1. 环境(Environment):智能体所处的空间——一局游戏、互联网、一份代码库、一间厨房、一套道路系统。 2. 动作集合(Set of actions):智能体能做什么——由它可访问的工具加以扩展。
环境决定了可能的动作,而智能体的工具清单则限定了它实际能操作的环境。一个唯一工具是文件编辑的编码智能体,就被局限在文件系统这一环境之中。
AI 智能体特别之处在于:它以基础模型(foundation model)作为「大脑」——处理任务、推理该做什么、规划一连串动作,并判断任务何时完成。它与简单的 LLM 应用的关键区别在于,模型掌控执行流程,而不仅仅是生成单条回复。
智能体在实践中的组成部分(出自第 6 章): - 规划(Planning):把目标拆解为可达成的子步骤;决定下一步调用哪个工具。 - 工具(Tools):读取类动作(搜索、检索、SQL 查询)与写入类动作(发邮件、写数据库、调用 API)。 - 记忆(Memory):短期记忆(在上下文内)、情景记忆(会话历史)、语义记忆(向量检索)、程序性记忆(系统提示词/习得行为)。
智能体的三大主要失效模式是:耗时过长(无限循环)、出错过多(误差累积),以及成本过高(工具使用失控)。
