CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 24 upvote

Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR

CÂU HỎI — Làm thế nào để tận dụng các quỹ đạo thành công từ các mô hình dị thể khác nhau nhằm khắc phục tình trạng nhóm thất bại hoàn toàn trong RLVR?

Nghiên cứu giải quyết vấn đề ngân sách rollout hữu hạn trong Reinforcement Learning with Verifiable Rewards (RLVR) vốn thường tạo ra các nhóm hoàn toàn thất bại. Các tác giả đề xuất GRAFT (Gated Replacement of Answer-Failed groups with peer Trajectories), một khung nhận thức off-policy thay thế các nhóm thất bại bằng các nhóm phản hồi đồng cấp nhiều thông tin. Bằng cách sử dụng trọng số tương thích mức chuỗi và cắt tỉa tỷ lệ quan trọng mức token để kiểm soát độ lệch, GRAFT cho phép học tập lẫn nhau giữa các mô hình dị thể mà không cần giáo viên mạnh chuyên biệt, cải thiện hiệu suất trên các benchmark toán học.

GRAFT cải thiện nhất quán cả hai mô hình so với GRPO với cùng ngân sách rollout trên mỗi mô hình, đạt trung bình 2.1 điểm và lên tới 4.5 điểm ở hiệu suất trung bình cấp mô hình qua 5 benchmark toán học.

Các quỹ đạo đồng cấp được lưu trữ giữ lại phần lớn mức tăng, cải thiện so với GRPO trung bình 1.8 điểm mà không cần đồng huấn luyện song song.

jadohu · 29 thg 9, 2026 đọc bản gốc ↗
↑