CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 57 upvote

Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

CÂU HỎI — Làm thế nào để khắc phục sự mất cân bằng tín hiệu cấp batch trong học tăng cường đa phần thưởng cho LLM?

Học tăng cường đa phần thưởng tối ưu hóa đồng thời nhiều mục tiêu hành vi nhưng thường gặp phải tình trạng tiến trình học tập không đều giữa các mục tiêu do mất cân bằng tín hiệu. Nghiên cứu này phân tích hiện tượng thông qua năng lượng lợi thế để chứng minh nó tỷ lệ thuận với mật độ nhóm hoạt động dưới chuẩn hóa GDPO. Từ đó, tác giả đề xuất phương pháp Density-Aware Reward Aggregation (DARA) sử dụng hệ số chỉnh sửa mật độ căn bậc hai nghịch đảo để ưu tiên tín hiệu từ các phần thưởng ít hoạt động hơn, giúp tăng tốc độ học tập trên các tác vụ gọi công cụ và lý luận toán học.

DARA đạt được tỷ lệ tuân thủ định dạng cao hơn với số bước huấn luyện ít hơn tới 26% trong tác vụ gọi công cụ.

DARA đạt được độ tuân thủ chiều dài gần bão hòa với số bước ít hơn tới 65% trong tác vụ lý luận toán học.

zhaihaotian · 30 thg 9, 2026 đọc bản gốc ↗
↑