VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control
Bài báo giới thiệu VA-Bench, một benchmark nhằm đánh giá khả năng trí tuệ không gian hữu hình thông qua việc quan sát, lý luận, hành động và sửa đổi dưới tình trạng quan sát không đầy đủ. VA-Bench bao gồm 14 họ tác vụ cơ sở (11 tay đơn và 3 tay đôi), các biến thể hình học và bố cục, cùng một track dài hạn gồm 5 đối tượng. Các thí nghiệm đánh giá 12 điều kiện mô hình chính cho thấy mô hình tốt nhất đạt điểm cao trong việc định vị mục tiêu nhưng điểm thành công trung bình tổng thể vẫn còn hạn chế, đồng thời việc chủ động điều khiển góc nhìn camera cải thiện rõ rệt tỷ lệ thành công của tác vụ.
Mô hình đạt điểm tốt nhất ghi nhận 100.0% ở khả năng định vị mục tiêu và 78.9% về quan hệ không gian trong lần chạy có chú thích.
Điểm thành công tác vụ trung bình ba lần chạy (macro-average) của mô hình tốt nhất chỉ đạt 53.93+/-3.17%.
Việc kiểm soát camera chủ động làm tăng tỷ lệ thành công của tác vụ từ 27.86% lên 57.50% trong một phép so sánh tương ứng.