Le PRM (Process Reward Model, ou modèle de récompense de processus) est un modèle d’évaluation qui attribue une récompense à chaque étape intermédiaire d’un raisonnement. Il juge la qualité, la logique et la cohérence de chaque « pensée » ou action, et non seulement la réponse finale.
Fonctionnement
Le PRM est entraîné sur des raisonnements annotés étape par étape : chaque étape est jugée correcte ou incorrecte par des humains ou par un modèle automatique. Pendant l’entraînement ou l’inférence, le PRM guide la recherche en temps réel : il évalue les branches de raisonnement et permet au modèle d’abandonner les impasses pour se concentrer sur les voies prometteuses.
Avantages
- Signal dense et granulaire : le modèle reçoit un retour à chaque étape, ce qui accélère l’apprentissage et améliore la qualité du raisonnement.
- Meilleure performance sur les tâches complexes : mathématiques, code, logique, planification.
- Détection précoce des erreurs : une erreur est identifiée avant qu’elle ne se propage à la réponse finale.
- Utilisation en test-time compute : le PRM permet de guider une recherche arborescente ou un échantillonnage multiple pour sélectionner le meilleur raisonnement.
Inconvénients
- Coût élevé : l’annotation étape par étape est longue et coûteuse, que ce soit par des humains ou par des modèles.
- Reward hacking : le modèle peut apprendre à produire des étapes qui « semblent » bonnes pour le PRM sans réellement améliorer le raisonnement.
- Biais de longueur : le PRM peut favoriser les raisonnements longs, même s’ils sont inutilement verbeux.
- Complexité technique : plus difficile à entraîner et à intégrer dans une boucle d’apprentissage par renforcement.
Analogie
Le PRM, c’est comme un coach qui suit l’élève pas à pas et l’arrête à chaque erreur. Il ne se contente pas de noter la copie finale : il vérifie chaque calcul, chaque déduction, chaque transition logique. Si l’élève se trompe à l’étape 3, le coach le lui signale immédiatement, ce qui l’empêche de propager l’erreur jusqu’à la réponse finale. L’élève apprend ainsi à raisonner correctement, pas seulement à obtenir la bonne réponse.
À retenir
Le PRM est un modèle de récompense puissant et précis, indispensable pour entraîner des modèles de raisonnement (LRM) sur des tâches complexes. Il fournit un signal dense qui guide le modèle étape par étape, mais il est plus coûteux et plus complexe à mettre en œuvre que l’ORM. Les approches modernes combinent souvent les deux pour tirer le meilleur parti de chaque méthode.