CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 69 upvote

GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

CÂU HỎI — Làm thế nào để xây dựng một không gian tiềm ẩn (latent space) chuẩn hình học nhằm cải thiện tính nhất quán 3D và chất lượng hình ảnh trong việc tạo dựng world generation?

Bài báo đề xuất geometry-native autoencoder (GAE) để khắc phục hạn chế của các bộ tạo hình ảnh vốn chỉ tập trung vào appearance và thiếu tính nhất quán 3D. Thay vì bổ sung hình học như một đầu ra độc lập, GAE tái tham số hóa các đặc trưng của mô hình nền tảng hình học thành một không gian tiềm ẩn nhỏ gọn, có thể giải mã đồng thời thành giao diện appearance, độ sâu (depth), camera và bản đồ điểm (point maps). Kết quả thực nghiệm kiểm soát cho thấy việc thay thế không gian tiềm ẩn bằng GAE giúp cải thiện chất lượng trực quan và độ đồng diễn 3D, với chỉ số FVD giảm đáng kể trên các dataset RealEstate10K và DL3DV, đồng thời giảm một nửa lỗi quỹ đạo camera trên RealEstate10K.

Thay thế latent thông thường bằng GAE làm giảm chỉ số FVD xuống 12.7% và 23.1% lần lượt trên các tập dữ liệu RealEstate10K và DL3DV.

Sai số quỹ đạo camera (camera-trajectory error) trên RealEstate10K bị giảm đi một nửa khi sử dụng GAE.

Latent không gian GAE có khả năng giải mã đồng thời thành appearance, depth, cameras và point maps.

Michaelqaz · 21 thg 9, 2026 đọc bản gốc ↗
↑