CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 48 votes

Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World

QUESTION — Comment entraîner des modèles vision-langage à modéliser les transitions d'état du monde physique par l'interaction ?

L'article présente Spatial-Interactor, un cadre qui entraîne des modèles vision-langage (VLM) à modéliser les transitions d'état du monde physique par l'interaction. Il organise l'apprentissage en un programme à trois niveaux couvrant les transitions d'état du monde passives L1, les transitions d'état actif L2 et les trajectoires d'interaction à long terme L3. Les auteurs construisent le jeu de données LSI-108K et appliquent une stratégie d'entraînement en deux étapes utilisant le Supervised Fine-Tuning (SFT) suivi de l'On-Policy Distillation (OPD). Les résultats expérimentaux sur plusieurs VLM et benchmarks spatiaux démontrent des gains constants dans la modélisation des transitions locales et l'intégration à long terme.

Construction du jeu de données Learning from Spatial Interaction (LSI-108K) à partir de trajectoires d'interaction simulées et réelles.

zwq2018 · 19 sept. 2026 lire l'original ↗
↑