Towards Full Pipeline FP8 Reinforcement Learning for LLMs
Nghiên cứu chỉ ra rằng quá trình huấn luyện Reinforcement Learning (RL) toàn pipeline sử dụng định dạng FP8 gặp sự cố bất ổn định (như bùng nổ entropy giữa chừng và sinh ra văn bản lỗi) do nhiễu lượng tử hóa FP8 tích lũy làm bóp méo tỷ lệ trọng số, đẩy các token có lợi thế âm ra ngoài vùng tin cậy và triệt tiêu gradient của chúng. Để giải quyết vấn đề này, các tác giả đề xuất Calibrated Clipping, một phương pháp động giúp căn chỉnh biên cắt FP8 với phân phối BF16. Thực nghiệm trên các thuật toán GRPO và DAPO với quy mô mô hình từ 8B đến 32B chứng minh phương pháp này loại bỏ được các đợt bùng nổ entropy và khôi phục hiệu suất tương đương baseline BF16.
Nhiễu lượng tử hóa FP8 tích lũy làm bóp méo tỷ lệ quan trọng, đẩy các token có lợi thế âm ra ngoài vùng tin cậy và làm mất gradient của chúng.
Phương pháp Calibrated Clipping được đề xuất để căn chỉnh các biên cắt FP8 với phân phối BF16.
Các thực nghiệm trên thuật toán GRPO và DAPO với các mô hình từ 8B đến 32B cho thấy phương pháp này loại bỏ hiện tượng bùng nổ entropy và đạt hiệu suất tương đương BF16.