BiasReducer: Adaptive Bias Mitigation for Reward Models
CÂU HỎI — Làm thế nào để giảm thiểu thiên kiến đối với các thuộc tính bề ngoài trong mô hình phần thưởng mà không cần huấn luyện lại toàn bộ?
Các mô hình phần thưởng thường ưu tiên các thuộc tính bề ngoài như độ dài hoặc độ tự tin thay vì chất lượng thực sự. Các phương pháp hiện tại đòi hỏi huấn luyện lại tốn kém hoặc áp dụng chỉnh sửa cố định cho một thiên kiến biết trước. Nghiên cứu này đề xuất BiasReducer, một framework nhẹ chỉ chỉnh sửa phần đầu phần thưởng dạng tuyến tính và lựa chọn các chỉnh sửa phù hợp cho từng tập dữ liệu mới bằng cách sử dụng bộ mã hóa kiểu sparse autoencoder. Phương pháp này cải thiện độ mạnh mẽ của mô hình trước các thiên kiến bề ngoài và chuyển giao hiệu quả sang các tác vụ hạ nguồn.
BiasReducer-M cải thiện ba benchmark trung bình lần lượt là 8,3, 18,0 và 6,9 điểm phần trăm trên năm mô hình phần thưởng.
Olivia121 · 26 thg 9, 2026
đọc bản gốc ↗