CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 60 votes

E-MoE: Enhanced Mixture-of-Experts for Non-Factorized Diffusion Language Models

QUESTION — Comment améliorer la qualité de génération en quelques étapes dans les modèles de diffusion masqués sans augmenter les paramètres actifs?

Les modèles de diffusion masqués génèrent des séquences en démasquant progressivement les jetons, mais leur processus inverse est généralement factorisé sur les positions, ce qui limite la qualité des échantillons dans le régime à quelques étapes. Cette étude propose Enhanced Mixture-of-Experts (E-MoE), qui construit le processus inverse comme un mélange de distributions factorisées sur un espace latent partagé discret fourni par les décisions de routage d'experts d'une dorsale Mixture-of-Experts. Cette approche améliore la génération en quelques étapes par rapport aux références factorisées sans augmenter les paramètres actifs.

ArsenyIvanov · 29 sept. 2026 lire l'original ↗
↑