跳转至

AI Engineering

概述

AI engineering(AI 工程)是指在现成的基础模型(foundation model)之上构建应用的过程。这一概念由 Chip Huyen 在其著作 AI Engineering(O'Reilly, 2025)中提出并系统化,描述了一门有别于传统 ML 工程的独立学科:AI 工程师不再从零开始开发模型,而是通过提示词工程、RAG、微调以及智能体(agent)模式,对现有基础模型加以适配,以解决具体的现实问题。

这门学科诞生于三股力量的汇聚:能力大幅提升的通用模型、对 AI 应用的投资激增,以及大幅降低的入门门槛(模型即服务的 API 让任何人无需 ML 专业背景或模型基础设施即可构建 AI 应用)。

AI 工程的兴起

基础模型经历了三个阶段的演进:

  • 语言模型 → 大语言模型(Large Language Model):在互联网规模的数据上进行自监督训练,使模型得以扩展到数十亿参数而无需标注数据。自监督是关键所在:语料中的每个句子都自带训练标签(即下一个 token),从而消除了标注瓶颈。
  • LLM → 基础模型:能够处理多模态输入(文本、图像、音频、代码)并胜任广泛任务——翻译、摘要、编码、推理、数据抽取——的单一模型。
  • 基础模型 → AI 工程:这些模型通过 API 对外开放,催生了一门聚焦于适配与应用、而非模型构建的全新工程学科。

关键的采用信号: - 四款开源 AI 工程工具(AutoGPT、Stable Diffusion WebUI、LangChain、Ollama)在发布后两年内累积的 GitHub star 数已超过 Bitcoin。 - LinkedIn 上将「Generative AI」「ChatGPT」「Prompt Engineering」添加到个人资料的从业者数量呈现 75% 的月度增长。 - 在 2023 年第二季度的财报电话会议上,每 3 家标普 500(S&P 500)公司中就有 1 家提及 AI——是上一年的 3 倍。

基础模型的应用场景

Huyen 分析了 205 个开源 AI 应用(GitHub star 数 ≥500),并开展了 50 场企业访谈,将这些应用归为八类:

类别 消费级示例 企业级示例
编码 代码补全、测试生成 自动化代码评审、迁移工具
图像与视频生产 头像照片生成、设计 广告生成、营销内容
写作 邮件润色、博客文章 文案撰写、SEO、绩效报告
教育 辅导、作文反馈 员工入职、技能提升培训
对话机器人 通用聊天机器人、AI 伴侣 客户支持、产品副驾(copilot)
信息聚合 摘要、与文档对话 市场调研、竞争情报
数据组织 图像搜索、memex 知识管理、文档处理
工作流自动化 出行规划、活动策划 数据抽取、销售线索生成

企业级采用模式:企业会先部署面向内部的应用(知识管理、生产力工具),再部署面向外部的应用(客户聊天机器人),以较慢的推进速度换取更低的合规与数据隐私风险。

职业暴露度(Eloundou et al., 2023):当 AI 能将某项任务的完成时间缩短 ≥50% 时,该任务即被视为「暴露」。数学家、报税员、金融分析师、作家和网页设计师的暴露度达到 100%。厨师、石匠和运动员的暴露度则接近于零。

AI 工程技术栈

Huyen 定义了三个层次:

  1. 基础设施层:硬件加速器(GPU/TPU)、云计算、存储和网络。由超大规模云厂商(hyperscaler)和专业厂商提供。
  2. 模型层:基础模型本身——包括闭源模型(GPT-4、Claude、Gemini)和开放权重模型(Llama、Mistral、Qwen)。团队既可通过 API 访问,也可自行托管。
  3. 应用层:AI 工程的发生之处——提示词工程、RAG 系统、智能体工作流、微调、评测流水线和部署基础设施。

AI 工程技术栈包含三门相互关联的学科:

  • 提示词工程(Prompt engineering):在不改动模型权重的前提下,编写指令、少样本示例和上下文来引导模型行为。
  • RAG(Retrieval-Augmented Generation,检索增强生成):用从外部知识库动态检索到的信息来补充模型上下文。
  • 微调(Finetuning):调整模型权重以提升其在特定任务或领域上的表现,成本远低于预训练。
  • 智能体(Agents):利用模型来规划并执行一系列动作的系统,借助工具与记忆来完成复杂任务。

AI 工程 vs. ML 工程

维度 传统 ML 工程 AI 工程
核心活动 构建并训练模型 适配并部署现有模型
数据需求 大规模标注数据集 少量提示词示例;微调用合成数据
核心技能 统计学、模型架构、训练优化 提示词设计、上下文工程、评测
迭代速度 数周到数月 数小时到数天
模型归属 团队拥有模型 模型以服务形式提供
评测 离线指标(accuracy、F1、AUC) LLM 充当评审、功能正确性、人工评测
主导技术 特征工程、超参数调优 上下文工程、提示词工程、RAG

传统 ML 模型依然有其价值——生产环境系统往往会同时结合传统 ML 模型与基础模型。同时精通二者的 AI 工程师具有显著优势。

规划 AI 应用

Huyen 提出了一套用于判断是否应当构建 AI 应用的框架:

  1. 应用场景评估:这项任务能从 AI 中获益吗?该任务对 AI 是「暴露」的吗?是否有足够的数据来评估质量?
  2. 设定预期:何为成功?哪些失败模式是可接受的?最低可行质量是多少?
  3. 里程碑规划:原型(验证可行性)→ 生产(部署给真实用户)→ 迭代(基于反馈持续改进)。
  4. 维护:AI 应用需要持续维护——模型弃用、能力漂移、数据漂移以及不断变化的用户预期,都需要主动管理。

构建 AI 应用最困难的部分往往不是 AI 本身,而是评测基础设施:定义何为「好」、收集标注示例,以及构建用于检测回归的自动化流水线。

最佳实践

挑战 描述 建议
起步即复杂 团队一开始就过度设计 从尽可能简单的架构起步;只有在证据支持时才增加组件
评测缺口 缺乏系统化的质量衡量手段 在扩张之前先建好评测基础设施;将其视为一等的工程关切
模型选型 选项过多且权衡关系不清 建立一套选型工作流:基线 → 准确率 → 成本/延迟;在自有数据上做基准测试
幻觉 模型生成看似合理实则错误的内容 对知识密集型任务使用 RAG;实施输出校验;校准用户预期
成本与延迟 前沿模型成本在规模上升时难以承受 将较简单的查询路由到更小的模型;实施缓存;剖析实际的 token 用量
提示词脆弱性 今天有效的提示词在模型更新后失效 为提示词做版本管理;纳入回归测试;在多个模型版本上测试

参见

参考资料