概念更新于 2026-06-21 · 版本 1.0

什么是基础模型?

基础模型是在大规模广泛数据上进行预训练的大型模型,可以适应广泛的下游任务。大语言模型(LLM)和大型多模态模型是典型的例子。该术语由斯坦福大学于 2021 年提出,体现了一种转变:组织不再针对每个任务训练定制模型,而是构建在共享的通用基座之上——然后通过提示、检索或微调使其专业化。

证据: 基准测试置信度: 来源: 基准测试来源: 论文

定义

基础模型是在广泛数据上预训练的大型通用模型,作为一个基座,可以通过提示、检索或微调来适应许多下游任务。

核心要点

  • 基础模型是适用于许多任务的通用基座。
  • LLM 和多模态模型是领先的示例。
  • 大多数构建在 Transformer 架构之上。
  • 能力随着数据、参数和计算规模的增长而涌现。
  • 您可以通过提示、检索(RAG)或微调来适配它们——极少需要从头开始训练。

背景

在基础模型出现之前,团队针对每个任务训练窄域模型。基础模型范式颠覆了这一点:一个大型模型在广泛的数据上进行一次预训练,然后随处复用。这种复用正是目前少数几个模型支撑着大多数 AI 产品的原因。

它也集中了能力——以及风险。因为有如此多的东西构建在少数几个基座之上,它们的偏见、故障和安全属性会传播到下游,这也是治理和评估如此重要的部分原因。

架构

预训练:一个拥有数百万到数万亿参数的模型从海量数据集中学习通用模式,通常采用自监督目标(如预测下一个 token)。Transformer 的注意力机制使这一过程具备可扩展性。

适配:对相同的基座进行专业化处理以供使用——零样本/少样本提示、针对新鲜或私有知识的检索增强生成,或针对行为和领域的微调。智能体将模型封装在工具和支撑系统(harness)中。

组件

Transformer 架构预训练数据与目标参数(权重)分词器适配层(提示 / RAG / 微调)

优势

  • 一个基座可跨多个任务复用。
  • 开箱即用的强大通用能力。
  • 无需从头训练即可快速适配。
  • 多模态变体涵盖文本、图像、音频等。

风险

  • 集中风险:缺陷会传播到构建在它们之上的所有事物。
  • 预训练成本高昂;极少有组织有能力进行。
  • 继承了训练数据中的偏见和缺陷。
  • 若不引入检索,知识将停留在训练时状态。

工具与技术

前沿 LLM(Claude、GPT、Gemini)开放权重模型(Llama、Mistral)多模态模型模型托管/推理平台

示例

  • 在整个组织中使用单一 LLM 进行总结、分类和草拟。
  • 通过检索而非重新训练,使基础模型适应特定领域。
  • 基于前沿模型构建智能体,并结合工具和记忆。

常见问题解答

基础模型和 LLM 是一回事吗?
LLM 是最常见的基础模型类型,专注于语言。基础模型还包括多模态和其他通用模型。
为什么它们被称为“基础”模型?
因为它们作为一个共享基础,许多应用程序都构建在其之上,而不是针对单一任务训练的模型。
我需要自己训练一个吗?
几乎不需要。预训练成本极其高昂;几乎所有的价值都来自于通过提示词、检索或微调来调整现有的基础模型。
智能体与基础模型有什么关系?
智能体将基础模型作为其推理核心,并包裹在工具、记忆和控制循环(即支撑系统/harness)中以执行操作。

参考文献