CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 13 votes

ROSS: Relearning from Self-Generated Rollouts through Selective Supervision

QUESTION — Comment réutiliser les rollouts historiques auto-générés pour améliorer le post-entraînement des LLM sans nécessiter de nouveaux rollouts de politique ?

Les auteurs présentent ROSS (Relearning from Self-Generated Rollouts through Selective Supervision), une méthode qui préserve les trajectoires historiques complètes comme contexte tout en appliquant la perte uniquement sur des continuations sélectionnées générées par le modèle. Cela résout le problème des données obsolètes ou erronées. Sur Qwen3.6-35B-A3B, ROSS améliore la moyenne MOPD sur six benchmarks de 58.40% à 62.20% et SWE-bench Verified de 64.20% à 68.40%. Ces résultats montrent que l'entraînement par self-rollout laisse une expérience comportementale réutilisable via du SFT hors ligne.

Sur Qwen3.6-35B-A3B, ROSS améliore la moyenne MOPD sur six benchmarks de 58.40% à 62.20%.

ROSS améliore SWE-bench Verified de 64.20% à 68.40%.

Hiiamein · 28 sept. 2026 lire l'original ↗
↑