When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
Nghiên cứu này phân tích hiện tượng phình to độ dài câu trả lời khiến học viên vượt quá ngân sách generation trong on-policy distillation (OPD). Tác giả phát hiện ra rằng sự không khớp về token kết thúc (termination-token mismatch) giữa base student và post-trained teacher là nguyên nhân chính gây ra vấn đề này, ngay cả khi tập dừng được khai báo là giống nhau. Họ chứng minh rằng việc coi các EOS token tương đương về mặt ngữ nghĩa như một hành động dừng chung sẽ làm giảm đáng kể hiện tượng này trên các họ mô hình Qwen3, Llama và Gemma.
Sự không khớp về termination-token giữa base student và post-trained teacher là nguồn gốc quan trọng gây ra length inflation.
Việc căn chỉnh decoding stopping set đơn lẻ là không đủ để giải quyết vấn đề.
Xử lý các EOS token tương đương về mặt ngữ nghĩa như một hành động dừng chung giúp giảm thiểu length inflation trên Qwen3, Llama và Gemma.