Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
Cet article comble le manque d'évaluation du raisonnement physique en plusieurs étapes dans les modèles de génération de vidéos égocentriques pour la planification incarnée. Les auteurs présentent Ego2Act, un banc d'essai comprenant 2 640 vidéos couvrant 110 tâches du monde réel avec une complexité variable, ainsi qu'Ego2ActJudge, un pipeline d'évaluation sans référence aligné sur le consensus humain pour l'achèvement des tâches et la plausibilité physique. Les résultats expérimentaux révèlent que les modèles actuels omettent ou exécutent partiellement des étapes et échouent systématiquement face à la dynamique physique fine lors de manipulations d'objets complexes.
Ego2Act features 2,640 videos from 110 real-world tasks across day-to-day settings, varying object clutter and multi-step complexity.
Ego2ActJudge achieves better task completion and physics plausibility evaluation alignment with human consensus compared to relevant baselines.