Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering
L'article présente Imagine3D-LLM, un grand modèle de langage multimodal (MLLM) qui apprend à assembler une représentation 3D compacte à partir d'images multi-vues avant de formuler des réponses textuelles. En ajoutant des jetons de résumé apprenables et en les décodant en une représentation 3D Gaussian Splatting supervisée par une perte de reconstruction photométrique, le modèle induit une correspondance inter-images. Cette méthode surpasse systématiquement les approches antérieures sur les benchmarks de raisonnement spatial.
Imagine3D-LLM learns to assemble a similar compact 3D representation of the scene and conditions its answer on this representation.
Reconstruction supervision induces stronger cross-frame correspondence within the LLM's underlying image features.
Imagine3D-LLM consistently outperforms prior approaches across multiple spatial reasoning and 3D understanding benchmarks.