Le SFT (Supervised Fine-Tuning, ou affinage supervisé) est une étape d’entraînement d’un grand modèle de langage (LLM) qui consiste à réentraîner un modèle pré-entraîné sur un jeu de données de démonstrations humaines, où chaque entrée (question, instruction, prompt) est associée à une sortie cible (réponse idéale rédigée par un humain). L’objectif est d’apprendre au modèle à imiter le comportement souhaité pour une tâche ou un domaine spécifique.
Place dans le cycle d’entraînement d’un LLM
Le SFT intervient après le pré-entraînement (où le modèle apprend les statistiques du langage sur d’immenses corpus) et avant, le cas échéant, le RLHF (apprentissage par renforcement à partir de retours humains). C’est la première étape d’alignement : elle transforme un modèle brut, qui « complète » du texte, en un modèle qui « répond » à des instructions.
| Étape | Objectif | Données |
|---|---|---|
| Pré-entraînement | Apprendre la structure du langage | Textes bruts (milliards de mots) |
| SFT | Apprendre à suivre des instructions | Paires (instruction, réponse idéale) |
| RLHF | Affiner selon les préférences humaines | Classements de réponses |
Fonctionnement
- Collecte de données : des annotateurs humains rédigent des réponses idéales à un large éventail de prompts (questions, tâches, demandes de résumé, de traduction, de code, etc.).
- Réentraînement : le modèle pré-entraîné est affiné sur ces paires (prompt → réponse) par descente de gradient, en minimisant l’erreur entre sa sortie et la réponse cible.
- Résultat : le modèle apprend à produire des réponses conformes au style, au ton et aux attentes des humains qui ont rédigé les démonstrations.
Caractéristiques clés
- Apprentissage par imitation : le modèle copie le comportement des annotateurs, sans exploration ni récompense explicite.
- Données de haute qualité : la qualité des démonstrations est cruciale ; des données médiocres produisent un modèle médiocre.
- Spécialisation possible : le SFT peut être utilisé pour spécialiser un modèle sur un domaine (droit, médecine, code) ou un style (formel, pédagogique).
- Coût modéré : moins coûteux que le RLHF, car il ne nécessite pas de modèle de récompense ni d’apprentissage par renforcement.
- Rapide : quelques milliers à quelques dizaines de milliers d’exemples suffisent souvent pour obtenir des résultats significatifs.
Différence avec le RLHF
| SFT | RLHF |
|---|---|
| Apprentissage par imitation | Apprentissage par récompense |
| Données : réponses idéales | Données : classements de préférences |
| Pas de modèle de récompense | Nécessite un modèle de récompense |
| Plus simple, moins coûteux | Plus complexe, plus coûteux |
| Première étape d’alignement | Étape d’affinage final |
Limites
- Plafond de performance : le modèle ne peut pas dépasser la qualité des démonstrations humaines.
- Biais des annotateurs : les préférences et les biais des rédacteurs se transmettent au modèle.
- Généralisation limitée : le modèle peut avoir du mal à généraliser à des tâches non vues dans les données SFT.
- Coût de production des données : rédiger des milliers de réponses de qualité est long et coûteux.
Exemples concrets
ChatGPT : après son pré-entraînement, le modèle a été affiné par SFT sur des conversations où des humains avaient rédigé des réponses utiles, honnêtes et inoffensives.
Claude : Anthropic a utilisé le SFT pour apprendre au modèle à suivre des instructions et à adopter un ton conforme à ses principes.
Modèle spécialisé : une entreprise juridique peut utiliser le SFT pour affiner un LLM sur des milliers de contrats annotés par des juristes, afin qu’il rédige des clauses conformes.
Analogie
Le SFT, c’est comme apprendre à un apprenti cuisinier en lui montrant des recettes déjà réussies. On ne lui explique pas les principes chimiques de la cuisson (pré-entraînement), on ne le note pas sur ses plats (RLHF) : on lui donne des exemples de plats parfaits, et il s’entraîne à les reproduire. Une fois qu’il sait imiter, on pourra affiner son goût avec des retours plus subtils (RLHF). Mais sans cette étape d’imitation, il ne saurait pas quoi produire.
À retenir
Le SFT est l’étape d’affinage supervisé qui transforme un modèle de langage brut en assistant capable de suivre des instructions. Il repose sur des démonstrations humaines de qualité et constitue la première brique de l’alignement. Simple et efficace, il est souvent complété par le RLHF pour affiner encore le comportement du modèle selon des préférences plus fines. C’est une étape indispensable dans la fabrication des LLM modernes.