SFT – Supervised Fine-Tuning

Le SFT (Supervised Fine-Tuning, ou affinage supervisé) est une étape d’entraînement d’un grand modèle de langage (LLM) qui consiste à réentraîner un modèle pré-entraîné sur un jeu de données de démonstrations humaines, où chaque entrée (question, instruction, prompt) est associée à une sortie cible (réponse idéale rédigée par un humain). L’objectif est d’apprendre au modèle à imiter le comportement souhaité pour une tâche ou un domaine spécifique.

Place dans le cycle d’entraînement d’un LLM

Le SFT intervient après le pré-entraînement (où le modèle apprend les statistiques du langage sur d’immenses corpus) et avant, le cas échéant, le RLHF (apprentissage par renforcement à partir de retours humains). C’est la première étape d’alignement : elle transforme un modèle brut, qui « complète » du texte, en un modèle qui « répond » à des instructions.

ÉtapeObjectifDonnées
Pré-entraînementApprendre la structure du langageTextes bruts (milliards de mots)
SFTApprendre à suivre des instructionsPaires (instruction, réponse idéale)
RLHFAffiner selon les préférences humainesClassements de réponses

Fonctionnement

  • Collecte de données : des annotateurs humains rédigent des réponses idéales à un large éventail de prompts (questions, tâches, demandes de résumé, de traduction, de code, etc.).
  • Réentraînement : le modèle pré-entraîné est affiné sur ces paires (prompt → réponse) par descente de gradient, en minimisant l’erreur entre sa sortie et la réponse cible.
  • Résultat : le modèle apprend à produire des réponses conformes au style, au ton et aux attentes des humains qui ont rédigé les démonstrations.

Caractéristiques clés

  • Apprentissage par imitation : le modèle copie le comportement des annotateurs, sans exploration ni récompense explicite.
  • Données de haute qualité : la qualité des démonstrations est cruciale ; des données médiocres produisent un modèle médiocre.
  • Spécialisation possible : le SFT peut être utilisé pour spécialiser un modèle sur un domaine (droit, médecine, code) ou un style (formel, pédagogique).
  • Coût modéré : moins coûteux que le RLHF, car il ne nécessite pas de modèle de récompense ni d’apprentissage par renforcement.
  • Rapide : quelques milliers à quelques dizaines de milliers d’exemples suffisent souvent pour obtenir des résultats significatifs.

Différence avec le RLHF

SFTRLHF
Apprentissage par imitationApprentissage par récompense
Données : réponses idéalesDonnées : classements de préférences
Pas de modèle de récompenseNécessite un modèle de récompense
Plus simple, moins coûteuxPlus complexe, plus coûteux
Première étape d’alignementÉtape d’affinage final

Limites

  • Plafond de performance : le modèle ne peut pas dépasser la qualité des démonstrations humaines.
  • Biais des annotateurs : les préférences et les biais des rédacteurs se transmettent au modèle.
  • Généralisation limitée : le modèle peut avoir du mal à généraliser à des tâches non vues dans les données SFT.
  • Coût de production des données : rédiger des milliers de réponses de qualité est long et coûteux.

Exemples concrets

ChatGPT : après son pré-entraînement, le modèle a été affiné par SFT sur des conversations où des humains avaient rédigé des réponses utiles, honnêtes et inoffensives.

Claude : Anthropic a utilisé le SFT pour apprendre au modèle à suivre des instructions et à adopter un ton conforme à ses principes.

Modèle spécialisé : une entreprise juridique peut utiliser le SFT pour affiner un LLM sur des milliers de contrats annotés par des juristes, afin qu’il rédige des clauses conformes.

Analogie

Le SFT, c’est comme apprendre à un apprenti cuisinier en lui montrant des recettes déjà réussies. On ne lui explique pas les principes chimiques de la cuisson (pré-entraînement), on ne le note pas sur ses plats (RLHF) : on lui donne des exemples de plats parfaits, et il s’entraîne à les reproduire. Une fois qu’il sait imiter, on pourra affiner son goût avec des retours plus subtils (RLHF). Mais sans cette étape d’imitation, il ne saurait pas quoi produire.

À retenir

Le SFT est l’étape d’affinage supervisé qui transforme un modèle de langage brut en assistant capable de suivre des instructions. Il repose sur des démonstrations humaines de qualité et constitue la première brique de l’alignement. Simple et efficace, il est souvent complété par le RLHF pour affiner encore le comportement du modèle selon des préférences plus fines. C’est une étape indispensable dans la fabrication des LLM modernes.

Les contenus de définition restent publics. Les ressources (outils, grilles, supports) liées à cette fiche sont disponibles dans l’espace membre.