CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 60 upvote

E-MoE: Enhanced Mixture-of-Experts for Non-Factorized Diffusion Language Models

CÂU HỎI — Làm thế nào để cải thiện chất lượng tạo sinh ít bước của mô hình khuếch tán mặt nạ mà không làm tăng số lượng tham số hoạt động?

Mô hình khuếch tán mặt nạ tạo ra các chuỗi bằng cách bỏ mặt nạ dần dần nhưng quá trình ngược lại thường bị phân rã theo vị trí, làm hạn chế chất lượng mẫu ở chế độ ít bước. Nghiên cứu này đề xuất Enhanced Mixture-of-Experts (E-MoE), xây dựng quá trình ngược lại dưới dạng hỗn hợp các phân phối phân rã trên một latent chia sẻ rời rạc được cung cấp bởi các quyết định định tuyến chuyên gia của một backbone Mixture-of-Experts. Phương pháp này cải thiện khả năng tạo sinh ít bước so với các đường cơ sở phân rã mà không làm tăng các tham số hoạt động.

ArsenyIvanov · 29 thg 9, 2026 đọc bản gốc ↗
↑