RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents
Nghiên cứu này chỉ ra rằng hiệu suất cao của các tác nhân embodied hiện đại thường là ảo ảnh do bối cảnh có độ entropy thấp, nơi thị giác là quá đủ và ngôn ngữ trở nên dư thừa. Các tác giả giới thiệu RoboFollow, một benchmark chẩn đoán dựa trên ba nguyên tắc: High Scene Entropy, Giao thức chẩn đoán phân cấp 4 cấp độ (L0-L3), và Chẩn đoán kiểm soát nhiễu. Đánh giá trên 9 mô hình VLA và WAM cho thấy hiệu suất xuất sắc ở mức L0 không đảm bảo chuyển giao sang các cấp độ cao hơn, đồng thời các giải pháp khắc phục phổ biến đều không thu hẹp được khoảng cách này.
Evaluation of nine VLA and WAM policies shows that strong L0 performance, where attained, does not reliably transfer to L1--L3 under our fine-tuning setup.
Representative mitigations, including stronger VLM backbones, QA co-training, LangForce, and Classifier-Free Guidance, all fail to close this gap.