Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation
Cet article propose Neighborhood On-Policy Self-Distillation (N-OPSD) pour améliorer l'entraînement des modèles de raisonnement mathématique en exploitant des perturbations de paramètres locales qui révèlent des corrections complémentaires alignées sur les références. Au lieu d'un paramétrage fixe, N-OPSD construit hors ligne un groupe compact d'experts gelés grâce à une sélection gloutonne basée sur des gains de jetons de référence filtrés, et utilise un routage en ligne via MaxPeak et une sélection par quantiles. Évalué sur AIME 2024, AIME 2025 et HMMT Février 2025 sur les modèles Qwen3-1.7B, 4B et 8B, N-OPSD améliore régulièrement la métrique Average@12 par rapport à l'OPSD standard.
Neighborhood OPSD improves the three-benchmark Average@12 over OPSD by 2.75, 1.67, and 1.94 points on Qwen3-1.7B, 4B, and 8B, respectively.