CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 7 votes

On the Diffusibility of High-Dimensional Latents

QUESTION — Pourquoi le fine-tuning des encodeurs visuels pour la reconstruction d'images réduit-il la dimensionnalité effective et impacte-t-il la génération ?

L'article étudie les Representation Autoencoders (RAEs) pour les modèles de diffusion opérant dans l'espace de caractéristiques d'encodeurs visuels. Les auteurs constatent que le fine-tuning de ces encodeurs réduit la dimensionnalité effective, forçant les modèles à ajuster des directions de bruit orthogonales en dehors de la variété de signal. Pour corriger cette inefficacité d'optimisation, ils proposent d'utiliser la paramétrisation des données propres (prédiction x_{0}) à la suite du velocity matching standard.

L'utilisation de la paramétrisation des données propres (prédiction x_{0}) améliore régulièrement les performances de génération texte-image à travers les encodeurs à forte reconstruction.

chfeng · 23 sept. 2026 lire l'original ↗
↑