Beyond the Current Scene: Event-Referential Grasping with Active View Selection
Ils présentent BeyondSCe, un système robotique zero-shot qui traite les requêtes spécifiant des cibles par leur rôle dans un événement passé plutôt que par leur nom ou leur apparence. Lorsque les cibles sont occultées, il combine un a priori d'événement issu de l'historique avec la géométrie de la scène actuelle pour sélectionner des points de vue de caméra susceptibles de révéler la cible. En utilisant des modèles pré-entraînés sans entraînement spécifique, il atteint des taux de réussite de préhension de 76 % pour les cibles initialement visibles et 77 % pour les cibles occultées, et augmente les taux de réussite de 75 % à 95 % sur des scènes fortement occultées tout en réduisant le nombre moyen de vues de 3,35 à 2,20.
Atteint des taux de réussite de préhension de 76 % et 77 % pour les cibles initialement visibles et occultées, respectivement.
Augmente les taux de réussite de préhension de 75 % à 95 % sur quatre scènes supplémentaires avec une forte occlusion.
Réduit le nombre moyen de vues de 3,35 à 2.20 par rapport à une référence de perception active.