The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
Cet article aborde l'instabilité et la dégradation des performances lors de l'extrapolation dans l'espace des sorties en distillation en politique (OPD). Les auteurs présentent RIDE (RL-Induced Direction Extrapolation), une méthode qui extrapole le changement induit par l'apprentissage par renforcement (RL) directement dans l'espace des représentations. En calculant le résidu entre le teacher et son point de contrôle pré-RL à chaque couche et position de token, RIDE régresse les états cachés du student vers des cibles déplacées au-delà du teacher le long de ce résidu. Des expériences sur quatre paires base/RL-teacher montrent que RIDE atteint ou dépasse systématiquement les performances du teacher entraîné par RL.
RIDE extrapole le changement induit par le RL directement dans l'espace des représentations à travers chaque couche et position de token.
La régression équivaut à maximiser une récompense directionnelle linéaire sous une pénalité quadratique centrée sur le teacher.
RIDE approche ou dépasse le teacher entraîné par RL sur chaque paire de modèles testée.