CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 21 upvote

Post-Training Leaves Behavioral Shadows on Unrelated Decisions

CÂU HỎI — Làm thế nào để truyền tải năng lực mô hình thông qua văn bản không liên quan đến tác vụ mà không cần dùng target-task examples, teacher logits hay teacher parameters?

Nhóm nghiên cứu giới thiệu Active Taskless Distillation (ATD), một phương pháp khai thác 'behavioral shadow' của quá trình post-training để truyền tải năng lực ngôn ngữ và lập trình chỉ dựa trên các cặp prompt-word lấy từ các từ thông thường mà mô hình teacher và student gần như bàng quan. Trong thử nghiệm với Qwen2.5-1.5B, ATD giúp cải thiện 5.34 pp trên HumanEval+ so với mô hình kiểm soát. Phương pháp này cũng cho thấy khả năng chuyển giao sang các lĩnh vực khoa học và suy luận thông thường mà không cần truyền trực tiếp trọng số hay logit.

Trong thử nghiệm lập trình chính với Qwen2.5-1.5B, 5,664 nses mang lại mức tăng 5.34 pp trên HumanEval+ so với control được khớp nhiễu chính xác.

Lines · 24 thg 9, 2026 đọc bản gốc ↗
↑