Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World
Bài báo giới thiệu Spatial-Interactor, một framework huấn luyện các vision-language models (VLMs) mô phỏng chuyển đổi trạng thái trong thế giới vật lý thông qua tương tác. Phương pháp này sử dụng chương trình học ba cấp độ bao gồm chuyển đổi trạng thái thế giới thụ động L1, chuyển đổi trạng thái tự thân chủ động L2 và quỹ đạo tương tác tầm dài L3. Họ xây dựng tập dữ liệu LSI-108K và áp dụng chiến lược huấn luyện hai giai đoạn gồm Supervised Fine-Tuning (SFT) kết hợp với On-Policy Distillation (OPD). Kết quả thực nghiệm cho thấy sự cải thiện nhất quán trong việc mô phỏng chuyển đổi cục bộ và tích hợp tầm dài trên nhiều VLM và các benchmark không gian.
Xây dựng tập dữ liệu Learning from Spatial Interaction (LSI-108K) từ các quỹ đạo tương tác mô phỏng và thực tế.