概念更新于 2026-06-21 · 版本 1.0

什么是微调?

微调是在较小且有针对性的数据集上继续训练预训练模型,以使其行为、风格或领域知识专业化。它比预训练便宜得多,并且会改变模型的权重——这与提示(prompting)或检索不同,后者不会改变模型。使用微调可以锁定一致的格式、语气或技能;当您需要新鲜或私有的事实时,请改用检索。

证据: 基准测试置信度: 来源: 基准测试来源: 论文

定义

微调是在特定数据集上进一步训练预训练模型的过程,以调整其权重以适应特定的行为、风格、格式或领域。

核心要点

  • 微调会更新模型权重;提示和 RAG 则不会。
  • 最适合保持一致的行为、风格或格式——不适用于获取新鲜事实。
  • 参数高效方法(LoRA)使其成本低廉且实用。
  • RLHF 是一种利用人类偏好进行微调的形式。
  • 首先默认使用提示和检索;当它们遇到瓶颈时再进行微调。

背景

预训练的基础模型是一个通用模型。微调可以缩小其范围:通过展示足够多的目标行为示例,模型会将其内化,因此您不再需要在每个提示中都进行指定。

它是与提示和检索并列的三大适配杠杆之一。其艺术在于选择合适的手段:针对模型应该如何表现进行微调,针对模型应该知道什么进行检索。

架构

全量微调会更新所有权重——功能强大但成本高昂。参数高效微调(PEFT),特别是 LoRA,在冻结基座模型的同时训练微小的适配器权重,以极低的成本获取了大部分收益。

指令微调和 RLHF 是特定的微调阶段,可将原始基座模型转化为有用且对齐的助手。数据集的质量远比其规模重要。

组件

预训练基座模型精选训练数据集训练目标PEFT / LoRA 适配器评估集

优势

  • 固化一致的行为、风格或格式。
  • 减少提示长度和每次调用的成本。
  • 可以传授基座模型所缺乏的特定技能。
  • PEFT 使其成本低廉且快速。

风险

  • 不会添加新鲜或私有的事实——对此请使用检索。
  • 存在灾难性遗忘或过拟合的风险。
  • 需要高质量、标注良好的数据集和评估集。
  • 与特定模型版本绑定;升级时存在迁移成本。

工具与技术

LoRA / PEFT 库服务商微调 APIRLHF / 偏好微调流水线评估套件

示例

  • 微调模型以始终输出严格的公司 JSON 格式。
  • 为生成的文案传授一致的品牌声调。
  • 使模型适应专业领域的术语。

常见问题解答

微调还是 RAG?
通过微调来改变模型的行为方式(风格、格式、技能);使用检索(RAG)为其提供新鲜或私有的知识。它们是互补的,而不是竞争关系。
微调昂贵吗?
全量微调可能很贵,但像 LoRA 这样的参数高效方法通过训练微小的适配器,使大多数用例的微调变得便宜且快速。
什么是 RLHF?
人类反馈强化学习是一种微调阶段,它利用人类的偏好判断使模型更加有用、无害和诚实。
我应该在什么时候进行微调?
在提示和检索遇到瓶颈之后。如果您可以通过更好的提示或相关的上下文来解决问题,请先这样做——这更便宜且更灵活。

参考文献