跳转至

基础模型

概述

基础模型(foundation model)是在广泛数据上大规模训练、可适配到各类下游任务的 AI 模型。它标志着一种转变:从"一个任务一个模型"的任务专用模型,转向无需从零重新训练即可胜任多种任务的通用模型。"基础"一词既点明了它们作为 AI 应用构建基石的重要性,也点明了它们可被微调以满足特定需求的能力。

GPT-4、Claude、Gemini、Llama 都是基础模型。当它们只处理文本时,也被称为大语言模型(LLM);当它们处理多种模态(文本、图像、音频、视频)时,则称为大型多模态模型(LMM)。

从语言模型到基础模型

语言模型编码关于语言的统计信息——即某个词(或 token)在给定上下文中出现的可能性有多大。基本单位是 token,可以是字符、单词或子词。GPT-4 平均每个 token 约合 ¾ 个英文单词。

语言模型有两类:

类型 工作方式 主要应用场景
掩码语言模型(如 BERT) 预测序列中任意位置缺失的 token(完形填空) 分类、情感分析、代码调试
自回归语言模型(如 GPT) 基于前文 token 预测下一个 token 文本生成、对话、编程、推理

自回归模型主导着现代 AI 应用,因为它们能生成开放式输出。

自监督(self-supervision)是规模化的关键使能因素。语言模型无需人工标注数据,而是直接从文本本身学习:每个句子既提供输入上下文,也提供预测目标。这使得在互联网规模的数据(书籍、维基百科、代码、网页)上训练成为可能,且没有标注成本,让模型得以增长到数十亿参数。

基础模型将语言模型扩展到多种数据模态。CLIP(OpenAI,2021)使用了来自互联网、无需人工标注的 4 亿对图文。GPT-4V 与 Claude 3 同时处理文本和图像。有些模型还能处理视频、音频、3D 资产和蛋白质结构。

模型架构

现代基础模型主要采用 transformer 架构,它借助注意力机制擅长并行处理 token 序列。关键设计维度:

  • 模型规模(参数量):GPT-1(2018)有 1.17 亿参数;当前的大模型超过 1000 亿。参数越多,通常学习容量越大,也需要更多训练数据。
  • 上下文长度:模型一次能处理的 token 数量。更长的上下文支持更复杂的任务,但会使计算成本按平方增长(若采用优化后的注意力则为线性增长)。
  • 词表大小:GPT-4 有 100,256 个 token;Mixtral 8x7B 有 32,000 个 token。

训练阶段

阶段 说明 由谁完成
预训练(Pre-training) 从随机权重开始在海量数据集上训练。自回归式:预测下一个 token。是计算最密集的步骤(InstructGPT 约占资源的 98%)。 仅模型开发方
后训练 / 有监督微调(SFT) 在精选的指令遵循样例上继续训练,教会模型恰当地响应用户请求。 模型开发方;有时也包括应用团队
偏好微调(RLHF/DPO) 用对比数据(优选 vs. 拒绝的回复)将模型对齐到人类偏好。 模型开发方

预训练与后训练的区别在于目标,而非过程——两者都更新模型权重。适配模型的应用开发者通常做的是微调,而非后训练。

采样与生成

基础模型是概率式的:给定提示词,它们会为下一个 token 生成一个概率分布,从中采样,把该 token 追加到序列,然后重复。这种概率本质既解释了 AI 输出的创造性,也解释了其不稳定性。

关键采样参数:

参数 控制什么 效果
温度(Temperature) 概率分布的陡峭程度 低(≤0.3):聚焦、确定;高(>1):有创意、多样
Top-p(核采样) 候选 token 的累积概率阈值 将采样限制在累积概率之和达到 p 的最可能 token 上
Top-k 从前多少个 token 中采样 对候选集设硬性上限

测试时计算(TTC):在推理时分配更多算力(如思维链、多数投票、Best-of-N 采样)可在不重新训练的情况下显著提升输出质量。OpenAI 的 o1/o3 系列明确地以 token 换取推理质量。

结构化输出:通过修改采样过程、只生成符合预期格式的 token(受约束解码),可以约束模型产出合法的 JSON、XML 或代码。这对以程序方式解析模型输出的生产系统至关重要。

概率本质与幻觉

由于输出是从概率分布中采样的,模型可能生成听起来合理、但事实错误的信息——即幻觉。几点关键含义:

  • 在温度非零时,两个完全相同的提示词会产生不同的输出
  • 模型可能自信地陈述它在训练中从未见过的错误事实
  • 缓解手段:RAG(用检索到的事实为回复接地)、降低温度、加入校验步骤、输出护栏

关键区分

基础模型 vs. 任务专用模型:基础模型是通用的;任务专用模型针对单一任务优化。基础模型可通过提示、RAG 或微调适配到特定任务,且所需数据通常远少于从零训练。

生成模型 vs. 嵌入模型:生成模型产出开放式输出(文本、图像);嵌入模型产出输入的定长向量表示。CLIP 是嵌入模型,GPT-4 是生成模型。嵌入模型对 RAG 检索至关重要。

开放 vs. 封闭模型:闭权重模型(GPT-4、Claude)仅能通过 API 访问;开权重模型(Llama、Mistral、Falcon)允许本地部署、微调与检视——代价是运维复杂度更高。

模型选型

模型选择涉及多个维度上的权衡:

维度 考量
质量 基准测试表现、领域专项能力、指令遵循
延迟 TTFT(首 token 时延)、TPOT(每个输出 token 时延)、总延迟
成本 输入与输出 token 定价;自托管 vs. API 成本
上下文长度 支持的最大输入;与你用例的相关性
模态 纯文本 vs. 多模态;视觉/音频任务所必需
部署 API(托管) vs. 自托管(开权重)
数据隐私 数据是否可以离开你的组织

自建 vs. 采购:使用现成的基础模型几乎总是比从零预训练更快、更省钱。预训练需要稀缺的专业能力、海量算力和数月工作。自建与采购的抉择更多出现在微调这一层面。

参见

参考资料