CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 13 upvote

RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents

CÂU HỎI — Các tác nhân hiện đại thực sự tuân theo ngôn ngữ hay chỉ tận dụng cấu trúc khung cảnh có độ entropy thấp?

Nghiên cứu này chỉ ra rằng hiệu suất cao của các tác nhân embodied hiện đại thường là ảo ảnh do bối cảnh có độ entropy thấp, nơi thị giác là quá đủ và ngôn ngữ trở nên dư thừa. Các tác giả giới thiệu RoboFollow, một benchmark chẩn đoán dựa trên ba nguyên tắc: High Scene Entropy, Giao thức chẩn đoán phân cấp 4 cấp độ (L0-L3), và Chẩn đoán kiểm soát nhiễu. Đánh giá trên 9 mô hình VLA và WAM cho thấy hiệu suất xuất sắc ở mức L0 không đảm bảo chuyển giao sang các cấp độ cao hơn, đồng thời các giải pháp khắc phục phổ biến đều không thu hẹp được khoảng cách này.

Evaluation of nine VLA and WAM policies shows that strong L0 performance, where attained, does not reliably transfer to L1--L3 under our fine-tuning setup.

Representative mitigations, including stronger VLM backbones, QA co-training, LangForce, and Classifier-Free Guidance, all fail to close this gap.

Mqleet · 22 thg 9, 2026 đọc bản gốc ↗
↑