ConceptsMis à jour 2026-06-21 · Version 1.0

Qu'est-ce que le fine-tuning ?

Le fine-tuning poursuit l'entraînement d'un modèle préentraîné sur un ensemble de données plus restreint et ciblé afin de spécialiser son comportement, son style ou ses connaissances sectorielles. Il est bien moins coûteux que le préentraînement et modifie les poids du modèle — contrairement au prompting ou à la récupération, qui laissent le modèle inchangé. Utilisez-le pour figer un format, un ton ou une compétence cohérente ; utilisez plutôt la récupération lorsque vous avez besoin de faits récents ou privés.

Preuve: BenchmarkConfiance: ÉlevéSource: BenchmarkSource: Publication scientifique

Définition

Le fine-tuning est le processus consistant à poursuivre l'entraînement d'un modèle préentraîné sur un ensemble de données ciblé afin d'adapter ses poids à un comportement, un style, un format ou un domaine spécifique.

Points clés

  • Le fine-tuning met à jour les poids du modèle ; ce n'est pas le cas du prompting et du RAG.
  • Idéal pour un comportement, un style ou un format cohérent — pas pour des faits récents.
  • Les méthodes à efficacité paramétrique (LoRA) le rendent économique et pratique.
  • Le RLHF est une forme de fine-tuning utilisant les préférences humaines.
  • Privilégiez d'abord le prompting et la récupération ; passez au fine-tuning lorsqu'ils atteignent un plateau.

Contexte

Un modèle de fondation préentraîné est généraliste. Le fine-tuning le spécialise : en lui présentant suffisamment d'exemples du comportement cible, le modèle l'assimile, de sorte que vous n'avez plus besoin de le spécifier dans chaque prompt.

C'est l'un des trois leviers d'adaptation, aux côtés du prompting et de la récupération. Tout l'art consiste à choisir le bon : le fine-tuning pour la façon dont le modèle doit se comporter, la récupération pour ce qu'il doit savoir.

Architecture

Le fine-tuning complet met à jour tous les poids — puissant mais coûteux. Le fine-tuning à efficacité paramétrique (PEFT), notamment LoRA, entraîne de petits poids d'adaptateurs tout en gelant la base, capturant la majeure partie des avantages pour une fraction du coût.

L'instruction tuning et le RLHF sont des étapes de fine-tuning spécialisées qui transforment un modèle de base brut en un assistant utile et aligné. La qualité du jeu de données importe bien plus que sa taille.

Composants

Modèle de base préentraînéJeu de données d'entraînement sélectionnéObjectif d'entraînementAdaptateurs PEFT / LoRAEnsemble d'évaluation

Avantages

  • Intègre un comportement, un style ou un format cohérent.
  • Réduit la longueur des prompts et le coût par appel.
  • Peut enseigner des compétences pointues qui manquent à un modèle de base.
  • Le PEFT le rend abordable et rapide.

Risques

  • N'ajoute pas de faits récents ou privés — utilisez la récupération pour cela.
  • Risque d'oubli catastrophique ou de surapprentissage (overfitting).
  • Nécessite un jeu de données de qualité, bien étiqueté, et un ensemble d'évaluation.
  • Vous lie à une version de modèle ; coûts de migration lors des mises à niveau.

Outils et technologies

Bibliothèques LoRA / PEFTAPI de fine-tuning des fournisseursPipelines de RLHF / d'ajustement des préférencesSuites d'évaluation

Exemples

  • Fine-tuner un modèle pour qu'il produise toujours un format JSON d'entreprise strict.
  • Enseigner une voix de marque cohérente pour les textes générés.
  • Adapter un modèle à la terminologie d'un domaine spécialisé.

FAQ

Fine-tuning ou RAG ?
Utilisez le fine-tuning pour modifier le comportement du modèle (style, format, compétence) ; utilisez la récupération (RAG) pour lui apporter des connaissances fraîches ou privées. Ils sont complémentaires et non concurrents.
Le fine-tuning est-il coûteux ?
Le fine-tuning complet peut l'être, mais les méthodes à efficacité paramétrique comme LoRA entraînent de minuscules adaptateurs et le rendent économique et rapide pour la plupart des cas d'usage.
Qu'est-ce que le RLHF ?
L'apprentissage par renforcement à partir des commentaires humains (RLHF) est une étape de fine-tuning qui utilise les jugements de préférence humaine pour rendre un modèle plus utile, inoffensif et honnête.
Quand devrais-je faire du fine-tuning ?
Après que le prompting et la récupération ont atteint un plateau. Si vous pouvez résoudre le problème avec un meilleur prompt ou un contexte pertinent, faites-le d'abord — c'est plus économique et plus flexible.

Références