CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 13 votes

RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents

QUESTION — Les agents incarnés modernes suivent-ils réellement les instructions linguistiques ou exploitent-ils la faible entropie de la scène ?

Cet article démontre que les taux de réussite élevés des agents incarnés modernes proviennent souvent d'une faible entropie de scène, où les indices visuels suffisent et les instructions textuelles sont ignorées. Les auteurs présentent RoboFollow, un benchmark de diagnostic caractérisé par une haute entropie de scène, un protocole hiérarchique à quatre niveaux (L0-L3) et un diagnostic à facteurs de confusion contrôlés. L'évaluation de neuf politiques VLA et WAM révèle qu'une bonne performance de base en L0 ne se transfère pas aux niveaux supérieurs.

Evaluation of nine VLA and WAM policies shows that strong L0 performance, where attained, does not reliably transfer to L1--L3 under our fine-tuning setup.

Representative mitigations, including stronger VLM backbones, QA co-training, LangForce, and Classifier-Free Guidance, all fail to close this gap.

Mqleet · 22 sept. 2026 lire l'original ↗
↑