ACLArena: Agent Continue Learning in Multi-stage Post-training
Nghiên cứu này giải quyết vấn đề thiếu công thức chuẩn cho Học tập liên tục của Tác nhân (Agent Continual Learning - ACL) trong quá trình hậu huấn luyện nhiều giai đoạn. Tác giả giới thiệu ACLArena, một framework để phân tích cơ chế quên lãng và tổng quát hóa ở cấp độ mô hình lẫn cấp độ token. Họ so sánh chéo các phương pháp gồm chưng cất trực tuyến đa giáo viên, tinh chỉnh tự chưng cất và hợp nhất mô hình. Từ đó, nhóm đề xuất một công thức ACL mới kết hợp phát lại ngoại tuyến trên các quỹ đạo chất lượng cao với một mạng lưới định tuyến gồm nhiều chuyên gia LoRA được huấn luyện chuyên biệt qua học tăng cường.
Xây dựng đường ống huấn luyện tuần tự để phân tích cơ chế quên lãng và tổng quát hóa ở cấp độ mô hình và token.
Đề xuất công thức ACL mới kết hợp phát lại ngoại tuyến với mạng định tuyến gồm nhiều chuyên gia LoRA chuyên biệt hóa qua RL.