ORM – Outcome reward Model

L’ORM (Outcome Reward Model, ou modèle de récompense de résultat) est un modèle d’évaluation qui attribue une récompense unique et globale à la fin d’une génération, en se basant uniquement sur la qualité de la réponse finale. Il ne juge pas le raisonnement intermédiaire : seul le résultat compte.

Fonctionnement

L’ORM est entraîné sur des paires de réponses (bonne/mauvaise) à une même question. Il apprend à prédire un score de qualité pour une réponse donnée, sans examiner les étapes qui ont conduit à cette réponse. Pendant l’entraînement par renforcement, le modèle de langage est récompensé lorsqu’il produit une réponse que l’ORM juge correcte.

Avantages

  • Simplicité : il ne nécessite qu’une vérification binaire (juste/faux) ou un classement global des réponses.
  • Faible coût : moins d’annotations humaines, moins de calcul pour l’entraînement.
  • Scalabilité : adapté aux tâches où la réponse finale peut être vérifiée automatiquement (mathématiques simples, questions à choix multiples).

Inconvénients

  • Récompense d’un raisonnement erroné : si la réponse finale est correcte par chance ou par hallucination, l’ORM récompense un raisonnement incorrect.
  • Signal pauvre : le modèle n’apprend pas à construire un raisonnement logique, seulement à maximiser ses chances d’arriver à la bonne réponse.
  • Difficulté sur les tâches complexes : pour les problèmes à plusieurs étapes, le signal de récompense est trop éloigné des actions intermédiaires.

Analogie

L’ORM, c’est comme un professeur qui ne corrige que la note finale sur la copie. Il ne regarde pas si l’élève a triché, s’il a fait un raisonnement absurde ou s’il a eu de la chance. Si la réponse est juste, il met une bonne note. L’élève peut donc apprendre à donner la bonne réponse sans comprendre pourquoi, ou pire, à deviner juste par hasard.

À retenir

L’ORM est un modèle de récompense simple et économique, adapté aux tâches où le résultat final est facilement vérifiable. Il est moins précis que le PRM pour les raisonnements complexes, car il ne guide pas le modèle étape par étape. Il reste utile pour l’entraînement à grande échelle et les tâches simples.

Les contenus de définition restent publics. Les ressources (outils, grilles, supports) liées à cette fiche sont disponibles dans l’espace membre.