One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
Nghiên cứu này đề xuất một framework huấn luyện chuyên gia nhận thức theo danh mục (category-aware) và tích hợp chính sách (policy-integration) để giải quyết hiện tượng cải thiện không đồng đều giữa các task category trong pooled agentic reinforcement learning. Bằng cách kết hợp Agentic-miniRL, chiến lược Refresh-Repair-Expand (RRE) và nhãn đa trục từ SWE Labeler, các tác giả huấn luyện những chuyên gia riêng biệt cho từng danh mục. Sau đó, kỹ thuật Label-routed multi-teacher on-policy distillation (MOPD) với ReLU-gated reward extrapolation gom nhóm các chuyên gia này thành một student duy nhất có thể triển khai mà không cần mô hình ngoài. Kết quả đạt được mức độ phân giải trung bình 58.04% trên Pro-618 và 59.00% trên SWE-bench Multilingual.
The final MOPD policy achieves mean resolution of 58.04% on Pro-618 and 59.00% on SWE-bench Multilingual.
It improves over the base model by 5.39 and 2.78 percentage points, respectively.