DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence
Nghiên cứu giới thiệu DC-SAE (Decoupled Compact Semantic Autoencoder), một tokenizer kết hợp kiến trúc mã hóa ngữ phân cấp vĩ mô và bộ mã hóa cấp pixel nhằm giải quyết bài toán đánh đổi giữa khả năng nén và tốc độ hội tụ của mô hình khuếch tán. DC-SAE tách biệt việc sử dụng encoder ngữ nghĩa để đạt tỷ lệ nén cao với bộ mã hóa giữ chi tiết pixel. Trên tập dữ liệu ImageNet ở độ phân giải 512x512, DC-SAE đạt tỷ lệ nén không gian 32times với các chỉ số 29.79 PSNR và 3.37 gFID, vượt trội so với baseline DC-AE lần lượt 13.5% và 54.9%. Thêm vào đó, mô hình DiT 1.6B-parameter tích hợp DC-SAE đạt 0.84 trên GenEval và 86.007 trên DPG-Bench.
Trên tập dữ liệu ImageNet ở độ phân giải 512x512, DC-SAE đạt 32times spatial compression với 29.79 PSNR và 3.37 gFID.
DC-SAE vượt trội hơn baseline DC-AE là 13.5% trên PSNR và 54.9% trên gFID.
Một mô hình DiT 1.6B-parameter sử dụng DC-SAE đạt 0.84 trên GenEval và 86.007 trên DPG-Bench ở độ phân giải 1024x1024.