On the Diffusibility of High-Dimensional Latents
QUESTION — Pourquoi le fine-tuning des encodeurs visuels pour la reconstruction d'images réduit-il la dimensionnalité effective et impacte-t-il la génération ?
L'article étudie les Representation Autoencoders (RAEs) pour les modèles de diffusion opérant dans l'espace de caractéristiques d'encodeurs visuels. Les auteurs constatent que le fine-tuning de ces encodeurs réduit la dimensionnalité effective, forçant les modèles à ajuster des directions de bruit orthogonales en dehors de la variété de signal. Pour corriger cette inefficacité d'optimisation, ils proposent d'utiliser la paramétrisation des données propres (prédiction x_{0}) à la suite du velocity matching standard.
L'utilisation de la paramétrisation des données propres (prédiction x_{0}) améliore régulièrement les performances de génération texte-image à travers les encodeurs à forte reconstruction.
chfeng · 23 sept. 2026
lire l'original ↗