CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 11 upvote

Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies

CÂU HỎI — Làm thế nào để truyền đạt các biểu diễn thế giới vật lý từ world model sang các mô hình Vision-Language-Action nhỏ gọn mà không làm tăng độ trễ thời gian chạy?

Nghiên cứu này đề xuất một phương pháp chưng cất (distillation) các biểu diễn nội tại từ một world model đóng băng vào trong các Vision-Language-Action (VLA) model thông qua một thuật ngữ căn chỉnh đặc trưng (feature-alignment term) duy nhất trong quá trình huấn luyện. Sau khi huấn luyện, bộ chiếu (projector) được loại bỏ, giúp chính sách triển khai hoàn toàn giống với baseline không chưng cất nhưng mang lại khả năng hiểu biết vật lý tốt hơn. Mô hình chạy với tốc độ 32 ms trên phần cứng tiêu dùng RTX 5090 và đạt hiệu suất cao trên các benchmark LIBERO và RoboCasa-GR1.

Chính sách triển khai chạy trong 32 ms và chiếm 1.86 GB trên GPU tiêu dùng RTX 5090, hoàn toàn giống về cấu trúc với baseline không chưng cất.

Học sinh 0.8B đạt 97.9% trên LIBERO.

Mô hình cải thiện độ chính xác từ 48.2% lên 50.5% trên tác vụ điều khiển robot hình nhân RoboCasa-GR1.

termanteus · 21 thg 9, 2026 đọc bản gốc ↗
↑