SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning
Les auteurs présentent SpatialSpeak, un cadre en deux étapes connectant le pré-entraînement à reconstruction native QA à l'apprentissage par chaîne de pensée spatiale pour les modèles vision-langage. La première étape combine des requêtes de géométrie locale et de contexte global, tandis que la seconde entraîne le modèle à dériver des réponses en utilisant une chaîne de pensée spatiale avec compensation visuelle. Sur ReVSI, QA-RP augmente le gain de CoT-VC de 2,6 à 6,9 points, et SpatialSpeak obtient un score de 62,8, dépassant la meilleure référence de 8,7 points.
Sur ReVSI, QA-RP augmente le gain de CoT-VC de 2,6 à 6,9 points.
SpatialSpeak obtient des résultats de pointe sur ReVSI, VSI-Bench et SPAR-Bench, avec un score ReVSI de 62,8 qui dépasse la base de comparaison la plus forte de 8,7 points.