CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 10 upvote

DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence

CÂU HỎI — Làm thế nào để đạt được tỷ lệ nén cao mà vẫn duy trì độ chi tiết cấp pixel và đẩy nhanh quá trình hội tụ của mô hình khuếch tán?

Nghiên cứu giới thiệu DC-SAE (Decoupled Compact Semantic Autoencoder), một tokenizer kết hợp kiến trúc mã hóa ngữ phân cấp vĩ mô và bộ mã hóa cấp pixel nhằm giải quyết bài toán đánh đổi giữa khả năng nén và tốc độ hội tụ của mô hình khuếch tán. DC-SAE tách biệt việc sử dụng encoder ngữ nghĩa để đạt tỷ lệ nén cao với bộ mã hóa giữ chi tiết pixel. Trên tập dữ liệu ImageNet ở độ phân giải 512x512, DC-SAE đạt tỷ lệ nén không gian 32times với các chỉ số 29.79 PSNR và 3.37 gFID, vượt trội so với baseline DC-AE lần lượt 13.5% và 54.9%. Thêm vào đó, mô hình DiT 1.6B-parameter tích hợp DC-SAE đạt 0.84 trên GenEval và 86.007 trên DPG-Bench.

Trên tập dữ liệu ImageNet ở độ phân giải 512x512, DC-SAE đạt 32times spatial compression với 29.79 PSNR và 3.37 gFID.

DC-SAE vượt trội hơn baseline DC-AE là 13.5% trên PSNR và 54.9% trên gFID.

Một mô hình DiT 1.6B-parameter sử dụng DC-SAE đạt 0.84 trên GenEval và 86.007 trên DPG-Bench ở độ phân giải 1024x1024.

henry-y1 · 30 thg 9, 2026 đọc bản gốc ↗
↑