CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 23 votes

BiasReducer: Adaptive Bias Mitigation for Reward Models

QUESTION — Comment atténuer le biais envers les attributs superficiels dans les modèles de récompense sans réentraînement complet?

Les modèles de récompense privilégient souvent des attributs superficiels tels que la longueur ou la confiance plutôt que la qualité réelle. Les méthodes existantes nécessitent un réentraînement coûteux ou des modifications fixes pour des biais connus. Cette étude propose BiasReducer, un cadre léger qui modifie uniquement la tête de récompense linéaire et sélectionne les modifications pertinentes pour chaque nouvel ensemble de données à l'aide d'un encodeur de type auto-encodeur parcimonieux. Cette approche améliore la robustesse du modèle de récompense face aux biais superficiels et se transfère efficacement aux tâches en aval.

BiasReducer-M améliore les trois benchmarks de 8,3, 18,0 et 6,9 points de pourcentage en moyenne sur cinq modèles de récompense.

Olivia121 · 26 sept. 2026 lire l'original ↗
↑