CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 36 upvote

Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

CÂU HỎI — Làm thế nào để cân bằng phản hồi từ nhiều mô hình chuyên gia trong quá trình chưng cất trực tuyến đa chuyên gia cho mô hình ngôn ngữ lớn?

Bài báo chỉ ra rằng quá trình chưng cất trực tuyến đa chuyên gia (MOPD) truyền thống gặp vấn đề phản hồi không cân bằng, trong đó phản hồi hướng dẫn (instruction-following) lấn át các lĩnh vực khác như toán học. Các tác giả đề xuất phương pháp Domain-Normalized MOPD (DN-MOPD) để điều chỉnh trọng số phản hồi của từng miền dựa trên độ phân tán đo được. Kết quả thực nghiệm trên các mô hình Qwen3.5 với sáu benchmark công khai cho thấy DN-MOPD cải thiện điểm số trung bình ở mọi kích thước và khôi phục phần lớn khả năng toán học bị mất.

On six public benchmarks, DN-MOPD improves the average score over MOPD at every size, across three random seeds and under two answer-length limits, and recovers most of the lost mathematics gain.

Controls with fixed domain weights show that the gain comes mainly from turning down instruction-following feedback rather than turning up mathematics alone, and that fixed weights close to those DN-MOPD measures perform comparably.

Combining specialists therefore requires deciding not only which one teaches, but also how strongly its feedback counts.

XINLI1997 · 28 thg 9, 2026 đọc bản gốc ↗
↑