E-MoE: Enhanced Mixture-of-Experts for Non-Factorized Diffusion Language Models
QUESTION — Comment améliorer la qualité de génération en quelques étapes dans les modèles de diffusion masqués sans augmenter les paramètres actifs?
Les modèles de diffusion masqués génèrent des séquences en démasquant progressivement les jetons, mais leur processus inverse est généralement factorisé sur les positions, ce qui limite la qualité des échantillons dans le régime à quelques étapes. Cette étude propose Enhanced Mixture-of-Experts (E-MoE), qui construit le processus inverse comme un mélange de distributions factorisées sur un espace latent partagé discret fourni par les décisions de routage d'experts d'une dorsale Mixture-of-Experts. Cette approche améliore la génération en quelques étapes par rapport aux références factorisées sans augmenter les paramètres actifs.
ArsenyIvanov · 29 sept. 2026
lire l'original ↗