CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 10 votes

DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence

QUESTION — Comment obtenir une compression spatiale élevée tout au long de la préservation des détails au niveau des pixels et de l'accélération de la convergence des modèles de diffusion?

L'article présente DC-SAE (Decoupled Compact Semantic Autoencoder), un tokenizer découplé combinant des encodeurs sémantiques macro pour des taux de compression élevés et des encodeurs au niveau des pixels pour les détails, résolvant le compromis entre la fidélité de compression et la vitesse de convergence de la diffusion. Sur le jeu de données ImageNet à une résolution de 512x512, DC-SAE atteint une compression spatiale de 32times avec 29.79 PSNR et 3.37 gFID, surpassant le modèle de référence DC-AE de 13.5% sur le PSNR et 54.9% sur le gFID. De plus, un DiT de 1.6B-parameter utilisant DC-SAE atteint 0.84 sur GenEval et 86.007 sur DPG-Bench à une résolution de 1024x1024.

Sur le jeu de données ImageNet avec une résolution de 512 times 512, DC-SAE atteint une compression spatiale de 32times, avec 29.79 PSNR et 3.37 gFID.

DC-SAE surpasse considérablement les baselines de tokenizers à haute compression précédents DC-AE de 13.5% et 54.9% respectivement sur le PSNR et le gFID.

Un DiT de 1.6B-parameter utilisant DC-SAE atteint 0.84 sur GenEval et 86.007 sur DPG-Bench pour la génération texte-image à une résolution de 1024 times 1024.

henry-y1 · 30 sept. 2026 lire l'original ↗
↑