From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention
Bài báo đề xuất PARTS (Policy Adaptation with RL on Targeted Subtasks), một framework RL thực tế tập trung vào các điểm nghẽn của tác vụ dài hạn mà không yêu cầu thu thập lại toàn bộ dữ liệu mẫu đầy đủ. Bằng cách sử dụng agent-generated selectors và success verifiers để kích hoạt các hiệu chỉnh phần dư kết hợp cùng online RL và success-reweighted retraining, hệ thống giảm thiểu can thiệp thủ công của con người. Trên các tác vụ robot bimanual YAM và single-arm Franka, PARTS cải thiện đáng kể tỷ lệ thành công toàn tác vụ.
Trên các tác vụ bimanual YAM và single-arm Franka, PARTS cải thiện tỷ lệ thành công toàn bộ tác vụ từ 32% lên 61% và từ 50% lên 95%.
PARTS nâng tỷ lệ thành công toàn bộ tác vụ lên hơn 25% dưới cùng một ngân sách robot-rollout trong khi đòi hỏi ít sự tham gia của con người hơn.