CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 69 votes

GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

QUESTION — Comment construire un espace latent géométrique natif pour améliorer la cohérence 3D et la qualité visuelle dans la génération de mondes?

L'article propose le geometry-native autoencoder (GAE) pour remédier à la limite des générateurs visuels centrés sur l'apparence et dépourvus de cohérence 3D. Plutôt que d'ajouter la géométrie comme sortie supplémentaire, GAE reparamètre les caractéristiques d'un modèle de fondation géométrique en un espace latent compact qui se décode conjointement en apparence, profondeur, caméras et cartes de points. Des comparaisons expérimentales contrôlées démontrent que l'utilisation de GAE améliore la qualité visuelle et la cohérence 3D, réduisant la FVD sur RealEstate10K et DL3DV tout en divisant par deux l'erreur de trajectoire de caméra sur RealEstate10K.

Le remplacement de l'espace latent par GAE améliore la qualité visuelle et la cohérence 3D mesurée indépendamment : la FVD chute de 12,7% et 23,1% sur RealEstate10K et DL3DV.

L'erreur de trajectoire de la caméra est divisée par deux sur RealEstate10K.

L'espace latent GAE est décodable conjointement en apparence, profondeur, caméras et cartes de points.

Michaelqaz · 21 sept. 2026 lire l'original ↗
↑