Sharpening Tax in Post-Training
Bài báo nghiên cứu tác động của hậu huấn luyện tăng cường (RL post-training) đối với các mô hình ngôn ngữ lớn, phát hiện ra hiện tượng đánh đổi giữa độ chính xác một lần (pass@1) và độ bao phủ giải pháp (pass@K) do thu hẹp không gian giải pháp thành hai cực. Tác giả đề xuất chỉ số 'Sharpening Tax' để đo lường mức độ suy giảm khả năng mở rộng trong thời gian kiểm thử. Để giảm thiểu vấn đề này, nhóm giới thiệu posterior-tempered group sampling (PTGS), một phương pháp lấy mẫu Bayes tự động điều chỉnh nhiệt độ theo độ khó của prompt. Thực nghiệm trên 14 cặp mô hình qua 3 benchmark cho thấy PTGS giúp giải quyết nhiều tác vụ hơn trong điều kiện lấy mẫu lặp lại.
Pre-trained LLM với bộ harness suyễn luận nhẹ thường vượt trội hơn mô hình hậu huấn luyện về độ bao phủ giải pháp (pass@K) khi có đủ ngân sách thời gian kiểm thử.
Sharpening Tax là một chỉ số chẩn đoán định lượng tổn thất về khả năng mở rộng thời gian kiểm thử sau hậu huấn luyện.
PTGS (posterior-tempered group sampling) giúp giảm thiểu Sharpening Tax, giải quyết nhiều tác vụ hơn và cải thiện độ chính xác một lần.