CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 21 upvote

Learning to Learn from Context: Synthetic Training from Perturbed Public Documents

CÂU HỎI — Làm thế nào để tổng hợp dữ liệu huấn luyện chất lượng cao từ các tài liệu công khai nhằm cải thiện khả năng học tập theo ngữ cảnh (context-dependent reasoning) của LLM mà không cần người gán nhãn?

Nghiên cứu này giải quyết điểm yếu của LLM trong việc học từ ngữ cảnh phức tạp bằng cách xây dựng một pipeline tự động sử dụng các tài liệu công khai có nhiễu nhẹ để tạo ra các dấu vết suy luận và câu trả lời. Pipeline bao gồm viết lại tài liệu để giảm thiểu rủi ro ghi nhớ, sinh câu hỏi và đáp án dựa trên ngữ cảnh, cùng bộ lọc chất lượng nghiêm ngặt. Trên CL-bench, phương pháp SFT nâng mô hình Qwen3.6-35B-A3B từ 13.7% lên 22.8%, và sau giai đoạn rubric-reward RL đạt 24.6%, vượt qua cả một số mô hình biên hàng nghìn tỷ tham số.

SFT nâng Qwen3.6-35B-A3B student từ 13.7% lên 22.8% trên CL-bench.

Giai đoạn rubric-reward RL tiếp theo đạt 24.6% trên CL-bench, sánh ngang với mô hình biên Qwen3.8-2.4T (23.9%) với hơn một nghìn tỷ tham số.

YangXiao-nlp · 27 thg 9, 2026 đọc bản gốc ↗
↑