BiasReducer: Adaptive Bias Mitigation for Reward Models
Les modèles de récompense privilégient souvent des attributs superficiels tels que la longueur ou la confiance plutôt que la qualité réelle. Les méthodes existantes nécessitent un réentraînement coûteux ou des modifications fixes pour des biais connus. Cette étude propose BiasReducer, un cadre léger qui modifie uniquement la tête de récompense linéaire et sélectionne les modifications pertinentes pour chaque nouvel ensemble de données à l'aide d'un encodeur de type auto-encodeur parcimonieux. Cette approche améliore la robustesse du modèle de récompense face aux biais superficiels et se transfère efficacement aux tâches en aval.
BiasReducer-M améliore les trois benchmarks de 8,3, 18,0 et 6,9 points de pourcentage en moyenne sur cinq modèles de récompense.