Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World
L'article présente Spatial-Interactor, un cadre qui entraîne des modèles vision-langage (VLM) à modéliser les transitions d'état du monde physique par l'interaction. Il organise l'apprentissage en un programme à trois niveaux couvrant les transitions d'état du monde passives L1, les transitions d'état actif L2 et les trajectoires d'interaction à long terme L3. Les auteurs construisent le jeu de données LSI-108K et appliquent une stratégie d'entraînement en deux étapes utilisant le Supervised Fine-Tuning (SFT) suivi de l'On-Policy Distillation (OPD). Les résultats expérimentaux sur plusieurs VLM et benchmarks spatiaux démontrent des gains constants dans la modélisation des transitions locales et l'intégration à long terme.
Construction du jeu de données Learning from Spatial Interaction (LSI-108K) à partir de trajectoires d'interaction simulées et réelles.