RLHF

Le RLHF (Apprentissage par renforcement à partir du retour humain) est une technique d’alignement des modèles d’intelligence artificielle qui consiste à entraîner un modèle à produire des réponses conformes aux préférences humaines, en utilisant des retours fournis par des annotateurs humains comme signal de récompense. C’est cette méthode qui a permis à des modèles comme ChatGPT ou Claude de passer d’un simple « perroquet probabiliste » à un assistant utile, sûr et conversationnel .

Les trois étapes du processus

Le RLHF se déroule généralement en trois phases distinctes :

  1. Pré-entraînement et fine-tuning supervisé (SFT)
    Le modèle de base est d’abord entraîné sur d’immenses corpus de textes. Ensuite, il est affiné sur un jeu de données de démonstrations écrites par des humains : pour chaque question, un humain rédige la réponse idéale. Le modèle apprend à imiter ce comportement par apprentissage supervisé . C’est l’étape du « fais comme moi ».
  2. Modèle de récompense (Reward Model)
    Des annotateurs humains comparent plusieurs réponses générées par le modèle à une même question et les classent par ordre de préférence (meilleure, moyenne, mauvaise). Ces classements servent à entraîner un modèle de récompense distinct, dont le rôle est de prédire le score qu’un humain attribuerait à une réponse donnée. Ce modèle devient le « juge automatique » qui notera les productions futures du modèle .
  3. Apprentissage par renforcement (RL)
    Le modèle de langage est alors entraîné par apprentissage par renforcement (souvent avec l’algorithme PPO, Proximal Policy Optimization). Il génère des réponses, le modèle de récompense les note, et le modèle ajuste ses paramètres pour maximiser ce score. Une contrainte de pénalité KL l’empêche de trop s’éloigner de son comportement initial, évitant ainsi qu’il ne « triche » pour obtenir de bons scores . C’est l’étape du « apprends de tes erreurs ».

Pourquoi le RLHF est essentiel

  • Alignement : il aligne le modèle sur les valeurs humaines (utilité, honnêteté, absence de nocivité).
  • Réduction des biais toxiques : il apprend au modèle à refuser les requêtes dangereuses ou offensantes.
  • Amélioration de la qualité conversationnelle : il rend les réponses plus naturelles, plus pertinentes et plus utiles.
  • Gestion de l’ambiguïté : il permet au modèle de demander des clarifications plutôt que d’inventer des réponses.

Limites et critiques

Coût et lenteur : le RLHF nécessite une armée d’annotateurs humains, ce qui est long et coûteux.

Biais des annotateurs : les préférences humaines ne sont pas universelles ; elles reflètent la culture, les valeurs et les biais des personnes qui annotent.

Manipulation du modèle de récompense : le modèle peut apprendre à « tromper » le modèle de récompense pour obtenir de bons scores sans être réellement utile (reward hacking).

Subjectivité : définir ce qu’est une « bonne » réponse est intrinsèquement subjectif, ce qui rend l’évaluation difficile.

Alternatives et évolutions

RLAIF (Reinforcement Learning from AI Feedback) : utiliser une IA pour générer les préférences à la place des humains, ce qui réduit les coûts mais introduit d’autres biais .

DPO (Direct Preference Optimization) : une méthode plus simple qui contourne l’étape du modèle de récompense en optimisant directement le modèle sur les préférences .

Constitutional AI : une approche où le modèle s’auto-critique et s’auto-corrige en fonction d’une « constitution » de principes .

Analogie

Le RLHF, c’est comme apprendre à un chien à rapporter la balle. Au début, vous lui montrez ce qu’il doit faire (fine-tuning supervisé). Ensuite, vous le récompensez quand il fait bien (modèle de récompense). Enfin, il apprend par lui-même à répéter les comportements qui lui valent une récompense, tout en évitant ceux qui n’en valent pas (apprentissage par renforcement). Le RLHF fait la même chose avec un modèle de langage : il le récompense quand il produit une réponse utile, honnête et inoffensive, et le pénalise dans le cas contraire.

À retenir

Le RLHF est la technique d’alignement qui a transformé les grands modèles de langage en assistants fiables et utiles. Il repose sur une combinaison de démonstrations humaines, de classements de préférences et d’apprentissage par renforcement. Malgré ses limites (coût, biais, subjectivité), il reste aujourd’hui la méthode de référence pour aligner les IA sur les valeurs humaines, et il continue d’évoluer vers des alternatives plus efficaces et moins coûteuses.

Les contenus de définition restent publics. Les ressources (outils, grilles, supports) liées à cette fiche sont disponibles dans l’espace membre.