概念更新于 2026-06-21 · 版本 1.0
什么是基础模型?
基础模型是在大规模广泛数据上进行预训练的大型模型,可以适应广泛的下游任务。大语言模型(LLM)和大型多模态模型是典型的例子。该术语由斯坦福大学于 2021 年提出,体现了一种转变:组织不再针对每个任务训练定制模型,而是构建在共享的通用基座之上——然后通过提示、检索或微调使其专业化。
证据: 基准测试置信度: 高来源: 基准测试来源: 论文
定义
基础模型是在广泛数据上预训练的大型通用模型,作为一个基座,可以通过提示、检索或微调来适应许多下游任务。
核心要点
- 基础模型是适用于许多任务的通用基座。
- LLM 和多模态模型是领先的示例。
- 大多数构建在 Transformer 架构之上。
- 能力随着数据、参数和计算规模的增长而涌现。
- 您可以通过提示、检索(RAG)或微调来适配它们——极少需要从头开始训练。
背景
在基础模型出现之前,团队针对每个任务训练窄域模型。基础模型范式颠覆了这一点:一个大型模型在广泛的数据上进行一次预训练,然后随处复用。这种复用正是目前少数几个模型支撑着大多数 AI 产品的原因。
它也集中了能力——以及风险。因为有如此多的东西构建在少数几个基座之上,它们的偏见、故障和安全属性会传播到下游,这也是治理和评估如此重要的部分原因。
架构
预训练:一个拥有数百万到数万亿参数的模型从海量数据集中学习通用模式,通常采用自监督目标(如预测下一个 token)。Transformer 的注意力机制使这一过程具备可扩展性。
适配:对相同的基座进行专业化处理以供使用——零样本/少样本提示、针对新鲜或私有知识的检索增强生成,或针对行为和领域的微调。智能体将模型封装在工具和支撑系统(harness)中。
组件
Transformer 架构预训练数据与目标参数(权重)分词器适配层(提示 / RAG / 微调)
优势
- 一个基座可跨多个任务复用。
- 开箱即用的强大通用能力。
- 无需从头训练即可快速适配。
- 多模态变体涵盖文本、图像、音频等。
风险
- 集中风险:缺陷会传播到构建在它们之上的所有事物。
- 预训练成本高昂;极少有组织有能力进行。
- 继承了训练数据中的偏见和缺陷。
- 若不引入检索,知识将停留在训练时状态。
工具与技术
前沿 LLM(Claude、GPT、Gemini)开放权重模型(Llama、Mistral)多模态模型模型托管/推理平台
示例
- 在整个组织中使用单一 LLM 进行总结、分类和草拟。
- 通过检索而非重新训练,使基础模型适应特定领域。
- 基于前沿模型构建智能体,并结合工具和记忆。
常见问题解答
- 基础模型和 LLM 是一回事吗?
- LLM 是最常见的基础模型类型,专注于语言。基础模型还包括多模态和其他通用模型。
- 为什么它们被称为“基础”模型?
- 因为它们作为一个共享基础,许多应用程序都构建在其之上,而不是针对单一任务训练的模型。
- 我需要自己训练一个吗?
- 几乎不需要。预训练成本极其高昂;几乎所有的价值都来自于通过提示词、检索或微调来调整现有的基础模型。
- 智能体与基础模型有什么关系?
- 智能体将基础模型作为其推理核心,并包裹在工具、记忆和控制循环(即支撑系统/harness)中以执行操作。