Le Reward Engineering (ingénierie de la récompense) est l’art et la science de concevoir le signal de récompense qui va guider l’apprentissage d’un agent d’Intelligence Artificielle, en particulier dans le cadre de l’apprentissage par renforcement (Reinforcement Learning – RL).
C’est le processus qui consiste à définir ce que l’IA doit optimiser, comment mesurer sa « réussite » à chaque étape, et comment traduire des objectifs humains complexes (souvent flous) en un signal numérique que la machine peut comprendre et maximiser.
Les outils et techniques modernes
- Constitutional AI (Anthropic) : Au lieu de faire annoter des milliers de réponses par des humains, on donne à l’IA une « constitution » (une liste de principes) et on lui demande de s’auto-évaluer et de se corriger. Le reward engineering devient semi-automatique.
- RLAIF (RL from AI Feedback) : Utiliser une IA pour évaluer les réponses d’une autre IA, réduisant la dépendance aux annotateurs humains.
- Inverse Reinforcement Learning (IRL) : Au lieu de définir la récompense, on observe un expert humain agir, et l’IA infère la récompense sous-jacente. C’est l’inverse du reward engineering classique.
- Preference Learning (apprentissage de préférences) : Frameworks comme TRL (Transformer Reinforcement Learning) de Hugging Face, ou OpenAI’s Spinning Up, qui implémentent le RLHF pour les LLM.
Terminologie et concepts liés
- Reinforcement Learning (RL) : Le paradigme d’apprentissage dont le reward engineering est la pierre angulaire.
- RLHF (Reinforcement Learning from Human Feedback) : La technique qui a popularisé le reward engineering moderne via les LLM.
- Alignment (Alignement) : Le champ de recherche qui vise à faire coïncider les objectifs de l’IA avec les intentions humaines.
- Reward Hacking / Specification Gaming : Le phénomène où l’IA exploite une faille dans la définition de la récompense.
- Goodhart’s Law : « Lorsqu’une mesure devient un objectif, elle cesse d’être une bonne mesure. » Le mantra du reward engineer.
- Actor-Critic, PPO (Proximal Policy Optimization), DPO (Direct Preference Optimization) : Algorithmes d’optimisation qui utilisent le signal de récompense pour faire évoluer l’IA.