From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention
QUESTION — Comment appliquer efficacement le réglage par apprentissage par renforcement à des tâches de manipulation à long terme dans le monde réel avec un minimum d'intervention humaine ?
L'article présente PARTS (Policy Adaptation with RL on Targeted Subtasks), un cadre d'apprentissage par renforcement réel qui concentre la pratique sur les goulots d'étranglement des tâches à long terme sans nécessiter de démonstrations complètes. En s'appuyant sur des sélecteurs générés par des agents et des vérificateurs de succès, il minimise l'intervention humaine tout en améliorant les taux de réussite.
Sur les tâches bimanual YAM et single-arm Franka, PARTS améliore le succès des tâches complètes de 32 % à 61 % et de 50 % à 95 %, respectivement.
Comparé aux méthodes de réglage fin par RL existantes, PARTS augmente le succès global des tâches de plus de 25 % sous le même budget de déploiement robotique.
Sichang0621 · 18 sept. 2026
lire l'original ↗