Distillation

La distillation (ou knowledge distillation) est une technique d’apprentissage automatique qui consiste à transférer les connaissances et les capacités d’un grand modèle (appelé « modèle enseignant » ou teacher) vers un modèle plus petit (appelé « modèle étudiant » ou student).

Le petit modèle apprend à reproduire le comportement du grand modèle, souvent avec une perte de performance minimale, mais avec des avantages significatifs en termes de taille, de vitesse et de coût d’inférence.

Comment ça fonctionne

Le modèle étudiant est entraîné non pas sur les données brutes uniquement, mais sur les sorties du modèle enseignant. Par exemple, au lieu d’apprendre à prédire la bonne réponse à partir des étiquettes d’un jeu de données, il apprend à imiter la distribution de probabilité que le grand modèle produit pour chaque token. Le grand modèle transmet ainsi non seulement la « bonne réponse », mais aussi sa manière de raisonner et ses nuances.

Dans le contexte des modèles de raisonnement (LRM), la distillation permet de transférer les capacités de raisonnement (chaînes de pensée longues, résolution de problèmes complexes, code, mathématiques) d’un très grand modèle vers un modèle plus petit et plus rapide.

Avantages de la distillation

  • Réduction de la taille : le modèle étudiant est beaucoup plus petit que le modèle enseignant.
  • Gain de vitesse : inférence plus rapide, latence réduite.
  • Baisse du coût : moins de calcul, moins de mémoire, moins d’énergie.
  • Accessibilité : permet de déployer des modèles performants sur des appareils mobiles ou des serveurs modestes.
  • Conservation des capacités : le petit modèle hérite d’une grande partie des compétences du grand modèle, notamment en raisonnement.

Limites

  • Perte de performance : le modèle étudiant ne peut pas égaler parfaitement le modèle enseignant, surtout sur les tâches les plus complexes.
  • Dépendance au teacher : la qualité de la distillation dépend de la qualité du grand modèle.
  • Coût initial : l’entraînement du modèle étudiant nécessite du calcul et des données.
  • Risque de biais transmis : les biais et erreurs du modèle enseignant sont reproduits chez l’étudiant.

Analogie

La distillation, c’est comme un chef étoilé qui forme un apprenti. Le chef (grand modèle) possède des années d’expérience, une intuition culinaire et des techniques raffinées. Il ne peut pas transmettre tout son savoir en une fois, mais il peut enseigner à l’apprenti (petit modèle) les gestes essentiels, les associations de saveurs et les méthodes de travail. L’apprenti ne sera pas aussi créatif que le chef, mais il pourra reproduire une grande partie de ses plats avec une efficacité et une rapidité bien supérieures. C’est exactement ce que fait la distillation : elle condense le savoir d’un grand modèle dans un format plus léger et plus opérationnel.

À retenir

La distillation est une technique de compression des modèles d’IA qui permet de transférer les capacités d’un grand modèle vers un modèle plus petit, plus rapide et moins coûteux. Dans le domaine des modèles de raisonnement, elle joue un rôle clé pour rendre les capacités avancées (chaînes de pensée, résolution de problèmes complexes) accessibles à des modèles légers et déployables à grande échelle. La bonne réponse à la question est donc la proposition.

Les contenus de définition restent publics. Les ressources (outils, grilles, supports) liées à cette fiche sont disponibles dans l’espace membre.