MInTRL: Off-policy Intervention can boost On-policy RL
Học tăng cường với phần thưởng kiểm chứng thường chạy theo chính sách (on-policy), giúp dữ liệu bám sát mô hình hiện tại nhưng giới hạn khả năng khám phá. Ngược lại, các phương pháp off-policy có thể tận dụng kiến thức bên ngoài nhưng dễ gặp vấn đề dịch chuyển phân phối lớn. Nghiên cứu giới thiệu Minimal Intervention Reinforcement Learning (MInTRL), sử dụng các can thiệp cục bộ thưa thớt trong các lượt sinh dữ liệu on-policy thông qua một chính sách giám khảo để thay thế các hậu tố sai bằng các bản sửa lỗi ngắn. Khi huấn luyện, MInTRL sử dụng mục tiêu hồi quy lợi thế ở cấp độ trình tự để loại bỏ việc lấy mẫu quan trọng. Thử nghiệm trên các benchmark toán học và lập trình cho thấy MInTRL vượt trội hơn các baseline tiêu chuẩn.
Across math and code benchmarks, MInTRL consistently outperforms standard on-policy and off-policy baselines.