FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders
QUESTION — Comment atténuer l'écart entre la reconstruction et la génération dans les auto-encodeurs de représentation sans modifier l'encodeur visuel pré-entraîné ?
Les auteurs présentent FuseReg, une méthode de régularisation qui remplace la sélection de couches heuristique par un entraînement sur des sous-ensembles aléatoires de couches d'encodeur. En pénalisant la sensibilité aux désaccords inter-couches, cette approche produit un décodeur unique capable de reconstruire à partir de diverses fusions de couches sans réentraînement. Sur ImageNet-256 avec DINOv3-L, le remplacement du décodeur réduit le gFID non guidé de 27 %, et la régularisation conjointe lors de l'entraînement par diffusion le réduit de 29 % sur DiT-Base.
Decoder replacement alone reduces unguided gFID by 27% with an unchanged RAEv2 DiT-XL generator.
Joint regularization of both stages reduces unguided gFID by 29% on DiT-Base.
Hongyang-Du · 25 sept. 2026
lire l'original ↗