DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence
L'article présente DC-SAE (Decoupled Compact Semantic Autoencoder), un tokenizer découplé combinant des encodeurs sémantiques macro pour des taux de compression élevés et des encodeurs au niveau des pixels pour les détails, résolvant le compromis entre la fidélité de compression et la vitesse de convergence de la diffusion. Sur le jeu de données ImageNet à une résolution de 512x512, DC-SAE atteint une compression spatiale de 32times avec 29.79 PSNR et 3.37 gFID, surpassant le modèle de référence DC-AE de 13.5% sur le PSNR et 54.9% sur le gFID. De plus, un DiT de 1.6B-parameter utilisant DC-SAE atteint 0.84 sur GenEval et 86.007 sur DPG-Bench à une résolution de 1024x1024.
Sur le jeu de données ImageNet avec une résolution de 512 times 512, DC-SAE atteint une compression spatiale de 32times, avec 29.79 PSNR et 3.37 gFID.
DC-SAE surpasse considérablement les baselines de tokenizers à haute compression précédents DC-AE de 13.5% et 54.9% respectivement sur le PSNR et le gFID.
Un DiT de 1.6B-parameter utilisant DC-SAE atteint 0.84 sur GenEval et 86.007 sur DPG-Bench pour la génération texte-image à une résolution de 1024 times 1024.