AI Engineering
概述
AI engineering(AI 工程)是指在现成的基础模型(foundation model)之上构建应用的过程。这一概念由 Chip Huyen 在其著作 AI Engineering(O'Reilly, 2025)中提出并系统化,描述了一门有别于传统 ML 工程的独立学科:AI 工程师不再从零开始开发模型,而是通过提示词工程、RAG、微调以及智能体(agent)模式,对现有基础模型加以适配,以解决具体的现实问题。
这门学科诞生于三股力量的汇聚:能力大幅提升的通用模型、对 AI 应用的投资激增,以及大幅降低的入门门槛(模型即服务的 API 让任何人无需 ML 专业背景或模型基础设施即可构建 AI 应用)。
AI 工程的兴起
基础模型经历了三个阶段的演进:
- 语言模型 → 大语言模型(Large Language Model):在互联网规模的数据上进行自监督训练,使模型得以扩展到数十亿参数而无需标注数据。自监督是关键所在:语料中的每个句子都自带训练标签(即下一个 token),从而消除了标注瓶颈。
- LLM → 基础模型:能够处理多模态输入(文本、图像、音频、代码)并胜任广泛任务——翻译、摘要、编码、推理、数据抽取——的单一模型。
- 基础模型 → AI 工程:这些模型通过 API 对外开放,催生了一门聚焦于适配与应用、而非模型构建的全新工程学科。
关键的采用信号: - 四款开源 AI 工程工具(AutoGPT、Stable Diffusion WebUI、LangChain、Ollama)在发布后两年内累积的 GitHub star 数已超过 Bitcoin。 - LinkedIn 上将「Generative AI」「ChatGPT」「Prompt Engineering」添加到个人资料的从业者数量呈现 75% 的月度增长。 - 在 2023 年第二季度的财报电话会议上,每 3 家标普 500(S&P 500)公司中就有 1 家提及 AI——是上一年的 3 倍。
基础模型的应用场景
Huyen 分析了 205 个开源 AI 应用(GitHub star 数 ≥500),并开展了 50 场企业访谈,将这些应用归为八类:
| 类别 | 消费级示例 | 企业级示例 |
|---|---|---|
| 编码 | 代码补全、测试生成 | 自动化代码评审、迁移工具 |
| 图像与视频生产 | 头像照片生成、设计 | 广告生成、营销内容 |
| 写作 | 邮件润色、博客文章 | 文案撰写、SEO、绩效报告 |
| 教育 | 辅导、作文反馈 | 员工入职、技能提升培训 |
| 对话机器人 | 通用聊天机器人、AI 伴侣 | 客户支持、产品副驾(copilot) |
| 信息聚合 | 摘要、与文档对话 | 市场调研、竞争情报 |
| 数据组织 | 图像搜索、memex | 知识管理、文档处理 |
| 工作流自动化 | 出行规划、活动策划 | 数据抽取、销售线索生成 |
企业级采用模式:企业会先部署面向内部的应用(知识管理、生产力工具),再部署面向外部的应用(客户聊天机器人),以较慢的推进速度换取更低的合规与数据隐私风险。
职业暴露度(Eloundou et al., 2023):当 AI 能将某项任务的完成时间缩短 ≥50% 时,该任务即被视为「暴露」。数学家、报税员、金融分析师、作家和网页设计师的暴露度达到 100%。厨师、石匠和运动员的暴露度则接近于零。
AI 工程技术栈
Huyen 定义了三个层次:
- 基础设施层:硬件加速器(GPU/TPU)、云计算、存储和网络。由超大规模云厂商(hyperscaler)和专业厂商提供。
- 模型层:基础模型本身——包括闭源模型(GPT-4、Claude、Gemini)和开放权重模型(Llama、Mistral、Qwen)。团队既可通过 API 访问,也可自行托管。
- 应用层:AI 工程的发生之处——提示词工程、RAG 系统、智能体工作流、微调、评测流水线和部署基础设施。
AI 工程技术栈包含三门相互关联的学科:
- 提示词工程(Prompt engineering):在不改动模型权重的前提下,编写指令、少样本示例和上下文来引导模型行为。
- RAG(Retrieval-Augmented Generation,检索增强生成):用从外部知识库动态检索到的信息来补充模型上下文。
- 微调(Finetuning):调整模型权重以提升其在特定任务或领域上的表现,成本远低于预训练。
- 智能体(Agents):利用模型来规划并执行一系列动作的系统,借助工具与记忆来完成复杂任务。
AI 工程 vs. ML 工程
| 维度 | 传统 ML 工程 | AI 工程 |
|---|---|---|
| 核心活动 | 构建并训练模型 | 适配并部署现有模型 |
| 数据需求 | 大规模标注数据集 | 少量提示词示例;微调用合成数据 |
| 核心技能 | 统计学、模型架构、训练优化 | 提示词设计、上下文工程、评测 |
| 迭代速度 | 数周到数月 | 数小时到数天 |
| 模型归属 | 团队拥有模型 | 模型以服务形式提供 |
| 评测 | 离线指标(accuracy、F1、AUC) | LLM 充当评审、功能正确性、人工评测 |
| 主导技术 | 特征工程、超参数调优 | 上下文工程、提示词工程、RAG |
传统 ML 模型依然有其价值——生产环境系统往往会同时结合传统 ML 模型与基础模型。同时精通二者的 AI 工程师具有显著优势。
规划 AI 应用
Huyen 提出了一套用于判断是否应当构建 AI 应用的框架:
- 应用场景评估:这项任务能从 AI 中获益吗?该任务对 AI 是「暴露」的吗?是否有足够的数据来评估质量?
- 设定预期:何为成功?哪些失败模式是可接受的?最低可行质量是多少?
- 里程碑规划:原型(验证可行性)→ 生产(部署给真实用户)→ 迭代(基于反馈持续改进)。
- 维护:AI 应用需要持续维护——模型弃用、能力漂移、数据漂移以及不断变化的用户预期,都需要主动管理。
构建 AI 应用最困难的部分往往不是 AI 本身,而是评测基础设施:定义何为「好」、收集标注示例,以及构建用于检测回归的自动化流水线。
最佳实践
| 挑战 | 描述 | 建议 |
|---|---|---|
| 起步即复杂 | 团队一开始就过度设计 | 从尽可能简单的架构起步;只有在证据支持时才增加组件 |
| 评测缺口 | 缺乏系统化的质量衡量手段 | 在扩张之前先建好评测基础设施;将其视为一等的工程关切 |
| 模型选型 | 选项过多且权衡关系不清 | 建立一套选型工作流:基线 → 准确率 → 成本/延迟;在自有数据上做基准测试 |
| 幻觉 | 模型生成看似合理实则错误的内容 | 对知识密集型任务使用 RAG;实施输出校验;校准用户预期 |
| 成本与延迟 | 前沿模型成本在规模上升时难以承受 | 将较简单的查询路由到更小的模型;实施缓存;剖析实际的 token 用量 |
| 提示词脆弱性 | 今天有效的提示词在模型更新后失效 | 为提示词做版本管理;纳入回归测试;在多个模型版本上测试 |
参见
- Agent Definition
- Agent Types
- Prompt Engineering
- RAG Architecture
- AI Engineering Architecture (Reference)
- Evaluation Frameworks
- Inference Optimization
参考资料
- AI Engineering: Building Applications with Foundation Models — Chip Huyen, O'Reilly Media, December 2024. ISBN 978-1-098-16630-4.
- Eloundou et al. (2023) — GPTs are GPTs: An Early Look at the Labor Market Impact Potential of Large Language Models