CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 18 votes

SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning

QUESTION — L'intégration de la reconstruction multi-vue et du raisonnement par chaîne de pensée spatiale améliore-t-elle les performances des modèles vision-langage ?

Les auteurs présentent SpatialSpeak, un cadre en deux étapes connectant le pré-entraînement à reconstruction native QA à l'apprentissage par chaîne de pensée spatiale pour les modèles vision-langage. La première étape combine des requêtes de géométrie locale et de contexte global, tandis que la seconde entraîne le modèle à dériver des réponses en utilisant une chaîne de pensée spatiale avec compensation visuelle. Sur ReVSI, QA-RP augmente le gain de CoT-VC de 2,6 à 6,9 points, et SpatialSpeak obtient un score de 62,8, dépassant la meilleure référence de 8,7 points.

Sur ReVSI, QA-RP augmente le gain de CoT-VC de 2,6 à 6,9 points.

SpatialSpeak obtient des résultats de pointe sur ReVSI, VSI-Bench et SPAR-Bench, avec un score ReVSI de 62,8 qui dépasse la base de comparaison la plus forte de 8,7 points.

YangCaoCS · 27 sept. 2026 lire l'original ↗
↑