Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies
Nghiên cứu này đề xuất một phương pháp chưng cất (distillation) các biểu diễn nội tại từ một world model đóng băng vào trong các Vision-Language-Action (VLA) model thông qua một thuật ngữ căn chỉnh đặc trưng (feature-alignment term) duy nhất trong quá trình huấn luyện. Sau khi huấn luyện, bộ chiếu (projector) được loại bỏ, giúp chính sách triển khai hoàn toàn giống với baseline không chưng cất nhưng mang lại khả năng hiểu biết vật lý tốt hơn. Mô hình chạy với tốc độ 32 ms trên phần cứng tiêu dùng RTX 5090 và đạt hiệu suất cao trên các benchmark LIBERO và RoboCasa-GR1.
Chính sách triển khai chạy trong 32 ms và chiếm 1.86 GB trên GPU tiêu dùng RTX 5090, hoàn toàn giống về cấu trúc với baseline không chưng cất.
Học sinh 0.8B đạt 97.9% trên LIBERO.
Mô hình cải thiện độ chính xác từ 48.2% lên 50.5% trên tác vụ điều khiển robot hình nhân RoboCasa-GR1.