Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning
Nghiên cứu này giới thiệu Entropic Advantage Policy Optimization (EAPO), một phương pháp gán credit hướng dẫn bằng entropy nhằm xử lý bất đối xứng giữa thành công và thất bại trong quá trình huấn luyện tăng cường cho mô hình ngôn ngữ lớn. Thay vì phạt tất cả các vị trí không chắc chắn, EAPO tăng cường tín hiệu cho các quyết định entropy cao ở câu trả lời đúng và phạt các quyết định entropy thấp ở câu trả lời sai, đồng thời giảm nhẹ hình phạt ở các vùng còn khả năng khôi phục. Thuật toán này giúp tận dụng các tín hiệu rollout sẵn có để cải thiện khả năng khám phá và hiệu suất lý luận.
EAPO xử lý bất đối xứng giữa thành công và thất bại bằng cách kết hợp entropy chính sách chuẩn hóa với dấu của lợi thế phản hồi.
Phương pháp này dẫn xuất credit ở cấp độ token trực tiếp từ các tín hiệu rollout hiện có mà không cần giám sát bổ sung.
Nghiên cứu chứng minh rằng EAPO đạt được hiệu suất tổng thể tốt nhất trên nhiều tác vụ lý luận khác nhau.