RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents
Cet article démontre que les taux de réussite élevés des agents incarnés modernes proviennent souvent d'une faible entropie de scène, où les indices visuels suffisent et les instructions textuelles sont ignorées. Les auteurs présentent RoboFollow, un benchmark de diagnostic caractérisé par une haute entropie de scène, un protocole hiérarchique à quatre niveaux (L0-L3) et un diagnostic à facteurs de confusion contrôlés. L'évaluation de neuf politiques VLA et WAM révèle qu'une bonne performance de base en L0 ne se transfère pas aux niveaux supérieurs.
Evaluation of nine VLA and WAM policies shows that strong L0 performance, where attained, does not reliably transfer to L1--L3 under our fine-tuning setup.
Representative mitigations, including stronger VLM backbones, QA co-training, LangForce, and Classifier-Free Guidance, all fail to close this gap.