CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 7 upvote

On the Diffusibility of High-Dimensional Latents

CÂU HỎI — Tại sao việc tinh chỉnh các encoder trực quan để tái tạo ảnh lại làm giảm chiều dữ liệu hiệu dụng và ảnh hưởng đến quá trình sinh ảnh?

Bài báo nghiên cứu Representation Autoencoders (RAEs) cho các mô hình khuếch tán trong không gian đặc trưng của encoder thị giác. Nhóm tác giả phát hiện ra rằng việc tinh chỉnh các encoder này để khôi phục chi tiết ảnh làm giảm chiều dữ liệu hiệu dụng, buộc mô hình phải khớp với các hướng nhiễu trực giao ngoài manifold tín hiệu. Để khắc phục sự kém hiệu quả trong tối ưu hóa này, họ đề xuất sử dụng tham số hóa dữ liệu sạch (dự đoán x_{0}) thay vì dự đoán vận tốc tiêu chuẩn trong flow matching. Kết quả cho thấy phương pháp này cải thiện hiệu năng sinh văn bản thành ảnh across các encoder.

Sử dụng tham số hóa dữ liệu sạch (x_{0}-prediction) cải thiện hiệu năng sinh văn bản thành ảnh trên các encoder có khả năng tái tạo mạnh.

chfeng · 23 thg 9, 2026 đọc bản gốc ↗
↑