CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 17 upvote

Scaling Laws for Looped Mixture of Experts

CÂU HỎI — Làm thế nào để mô hình hóa đồng thời tính lặp (recurrence) và độ thưa (sparsity) trong các kiến trúc transformer?

Họ giới thiệu Loop Scaling Laws, định luật chia tỷ lệ đầu tiên mô hình hóa đồng thời tính lặp (recurrence) và độ thưa (sparsity) cùng với kích thước mô hình và dữ liệu. Cốt lõi của nó là một ánh xạ lặp có giới hạn, có điều kiện theo độ thưa nhằm mô tả mức tăng hiệu quả tham số từ việc lặp vòng. Các định luật này dự đoán độ mất mát giữ lại chính xác hơn các phương pháp cũ và phục hồi các định luật chia tỷ lệ thông thường như các trường hợp đặc biệt. Các đánh giá hạ nguồn cho thấy độ thưa mang lại hiệu quả tham số hoạt động ~3x, tính lặp mang lại hiệu quả tổng tham số ~2x về mặt suy luận. Ở quy mô nghìn tỷ token, một looped MoE sử dụng định luật này có thể khớp với mô hình không lặp lớn hơn ~2x trên các benchmark suy luận trong khi hỗ trợ test-time scaling.

Độ thưa mang lại hiệu quả tham số hoạt động khoảng ~3x.

Tính lặp mang lại hiệu quả tổng tham số khoảng ~2x về mặt suy luận.

Ở quy mô nghìn tỷ token, looped MoE khớp với mô hình không lặp lớn hơn ~2x trên các benchmark suy luận.

yanbeic · 30 thg 9, 2026 đọc bản gốc ↗
↑