CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 16 upvote

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

CÂU HỎI — Làm thế nào để Multimodal Large Language Models tích hợp thông tin đa góc nhìn thành hiểu biết không gian 3D mạch lạc trước khi trả lời?

Bài báo giới thiệu Imagine3D-LLM, một MLLM được thiết kế để học cách lắp ráp một không gian 3D nhỏ gọn từ nhiều góc nhìn hình ảnh trước khi đưa ra câu trả lời. Mô hình bổ sung các token tóm tắt có thể học, giải mã chúng thành dạng 3D Gaussian Splatting dưới sự giám sát của hàm mất mát tái tạo quang học, đồng thời huấn luyện chung với mục tiêu dự đoán token tiếp theo. Phương pháp này giúp lan truyền tín hiệu nhận thức 3D xuyên suốt mô hình, vượt qua các cách tiếp cận truyền thống trên các benchmark không gian.

Imagine3D-LLM learns to assemble a similar compact 3D representation of the scene and conditions its answer on this representation.

Reconstruction supervision induces stronger cross-frame correspondence within the LLM's underlying image features.

Imagine3D-LLM consistently outperforms prior approaches across multiple spatial reasoning and 3D understanding benchmarks.

HwanChang0106 · 29 thg 9, 2026 đọc bản gốc ↗
↑