ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
QUESTION — Comment réutiliser les rollouts historiques auto-générés pour améliorer le post-entraînement des LLM sans nécessiter de nouveaux rollouts de politique ?
Les auteurs présentent ROSS (Relearning from Self-Generated Rollouts through Selective Supervision), une méthode qui préserve les trajectoires historiques complètes comme contexte tout en appliquant la perte uniquement sur des continuations sélectionnées générées par le modèle. Cela résout le problème des données obsolètes ou erronées. Sur Qwen3.6-35B-A3B, ROSS améliore la moyenne MOPD sur six benchmarks de 58.40% à 62.20% et SWE-bench Verified de 64.20% à 68.40%. Ces résultats montrent que l'entraînement par self-rollout laisse une expérience comportementale réutilisable via du SFT hors ligne.
Sur Qwen3.6-35B-A3B, ROSS améliore la moyenne MOPD sur six benchmarks de 58.40% à 62.20%.
ROSS améliore SWE-bench Verified de 64.20% à 68.40%.
Hiiamein · 28 sept. 2026
lire l'original ↗