Explore Broadly, Reason Sharply: Push Small Models toward the Frontier via Sampling
Nghiên cứu đề xuất Parallel Power Tempering (PPT), một phương pháp thay thế cho hậu huấn luyện RL dựa trên lấy mẫu có tăng cường lực (power-sharpened sampling) tại thời điểm suy luận. Bằng cách chạy nhiều bản sao tương tác song song ở các mức độ tăng cường khác nhau, PPT giải quyết bài toán đánh đổi giữa khám phá và khai thác: các bản sao năng lượng thấp khám phá quỹ đạo đa dạng trong khi chuỗi năng lượng cao khai thác phản hồi có xác suất cao. Nghiên cứu này cũng giảm thiểu sai số cắt cụt (truncation bias) và tối ưu chiến lược hoán đổi. Thử nghiệm diện rộng cho thấy PPT cải thiện đáng kể việc lấy mẫu đơn chuỗi và vượt trội các mô hình huấn luyện bằng RL.
Parallel Power Tempering (PPT) áp dụng phương pháp lấy mẫu tăng cường lực thông qua song song hóa tempering để giải quyết bài toán khám phá - khai thác tại thời điểm suy luận.
PPT giảm thiểu sai số cắt cụt (truncation bias) thường gặp ở các bộ lấy mẫu công suất trước đây.
Thực nghiệm cho thấy PPT cải thiện đáng kể việc lấy mẫu đơn chuỗi và vượt trội hơn các mô hình được hậu huấn luyện bằng RL.