CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 16 upvote

Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation

CÂU HỎI — Làm thế nào để tận dụng các nhiễu loạn tham số cục bộ nhằm cải thiện quá trình tự chưng cất trực tuyến cho các mô hình suy luận toán học?

Nghiên cứu này đề xuất phương pháp Neighborhood On-Policy Self-Distillation (N-OPSD) nhằm cải thiện việc huấn luyện các mô hình suy luận toán học bằng cách khai thác các nhiễu loạn tham số cục bộ để cung cấp thêm các bản sửa lỗi tham chiếu bổ sung. Thay vì sử dụng một cài đặt tham số cố định, N-OPSD xây dựng ngoại tuyến một nhóm nhỏ các chuyên gia đóng băng thông qua việc lựa chọn tham lam các phần thưởng token tham chiếu đã được lọc. Trực tuyến định tuyến kết hợp việc chọn token mỏ neo bằng MaxPeak và lựa chọn lượng tử giữa các chuyên gia. Kết quả đánh giá trên các benchmark AIME và HMMT cho thấy phương pháp này cải thiện đáng kể điểm số Average@12 trên các mô hình Qwen3 kích thước 1.7B, 4B và 8B.

Neighborhood OPSD improves the three-benchmark Average@12 over OPSD by 2.75, 1.67, and 1.94 points on Qwen3-1.7B, 4B, and 8B, respectively.

dingyii · 30 thg 9, 2026 đọc bản gốc ↗
↑