VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control
L'article présente VA-Bench, un benchmark conçu pour évaluer l'intelligence spatiale incarnée par le biais de l'observation, du raisonnement, de l'action et de la révision sous des preuves visuelles incomplètes. VA-Bench comprend 14 familles de tâches de base, des variantes de géométrie et une piste de composition à long horizon. L'évaluation de 12 conditions de modèles primaires révèle que si les meilleurs modèles obtiennent de bons scores en localisation, leur succès global moyen reste limité, et le contrôle actif de la caméra améliore considérablement le succès des tâches.
Le modèle le plus performant obtient 100.0% sur la localisation des cibles et 78.9% sur les relations spatiales lors de l'exécution annotée.
Le succès moyen des tâches sur trois exécutions du meilleur modèle n'est que de 53.93+/-3.17%.
Le contrôle actif de la caméra fait passer le succès de la tâche de 27.86% à 57.50% dans une comparaison appariée.