CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 19 votes

PixelDense: Dense Prediction as Representation Alignment for Pixel Diffusion

QUESTION — Comment exploiter simultanément des modèles de prédiction dense comme cibles d'alignement pour la diffusion de pixels sans provoquer de conflits de gradients ?

L'article présente PixelDense, une méthode qui achemine les encodeurs sémantiques (DINOv2, SAM2) via un flux de projection sémantique et les encodeurs géométriques (Depth Anything v2, Metric3D v2) via un flux géométrique, tout en appliquant une pénalité d'orthogonalité dans l'espace des poids pour maintenir les flux dans des sous-espaces disjoints. Cela résout la concurrence des gradients lors de l'entraînement des transformers de diffusion. Appliqué à PixelGen et DeCo, PixelDense augmente le score GenEval Overall de PixelGen-XXL de 0.7927 à 0.8093, améliore le PQ jusqu'à 53.1% et réduit l'AbsRel de profondeur de 36.0% à $\tau=0.5$, tout en atteignant le pic GenEval 1.23x plus rapidement.

PixelDense élève le GenEval Overall de PixelGen-XXL de 0.7927 à 0.8093.

Montre un gain de PQ allant jusqu'à 53.1% et une réduction de l'AbsRel de profondeur de 36.0% à $\tau=0.5$.

Atteint le pic GenEval de la référence 1.23x plus rapidement à partir d'une initialisation aléatoire.

xsourse · 30 sept. 2026 lire l'original ↗
↑