Lightning Weave: Improving the Accuracy-Efficiency Frontier of Reasoning Models through Capability Composition
CÂU HỎI — Làm thế nào để cải thiện đồng thời độ chính xác suy luận và hiệu năng tính toán của LLM thông qua việc kết hợp các khả năng đã học độc lập?
Nhóm tác giả giới thiệu Lightning Weave, một khung hậu kỳ kết hợp các khả năng được học độc lập từ các mô hình chuyên gia vào một học viên duy nhất thông qua on-policy distillation. Khung này sử dụng log-ratio shifts đã căn chỉnh và Tilted-Target DOPD để chuyển đổi tín hiệu thành mục tiêu học tập ổn định mà không cần phục vụ nhiều mô hình neo trực tuyến cùng lúc. Kết quả trên Qwen3.5-4B cho thấy độ chính xác HMMT 2025 tăng từ 59.2% lên 64.0% với ít hơn 10.7% token phản hồi, và LiveCodeBench v5 tăng từ 41.7% đến 54.2% với ít hơn 9.6% token phản hồi.
On Qwen3.5-4B, it raises HMMT 2025 accuracy from 59.2% to 64.0% with 10.7% fewer response tokens, and LiveCodeBench v5 accuracy from 41.7% to 54.2% with 9.6% fewer response tokens.
gbcfchc · 13 thg 9, 2026
đọc bản gốc ↗