CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 11 upvote

Modality-Autoregressive World-Action Models

CÂU HỎI — Làm thế nào để kết hợp hiệu quả nhiều modal thị giác trong các world-action models thay vì chỉ dự đoán RGB?

Bài báo giới thiệu ModAR, một world-action model (WAM) thực hiện khử nhiễu tự hồi quy trên nhiều modal tương lai trước khi dự đoán hành động. Bằng cách huấn luyện từ đầu và thử nghiệm với các kết hợp dữ liệu khác nhau, các tác giả phát hiện ra rằng việc dự đoán point tracks, DINO features và depth maps mang lại lợi ích rõ rệt, trong khi RGB thuần túy không tạo ra ưu thế nhất quán. ModAR vượt qua các mô hình WAM hiện có về tỷ lệ thành công trung bình. Khi tinh chỉnh từ Flex-$\pi$, ModAR đạt tỷ lệ thành công tương đương hoặc cao hơn nhưng sử dụng lượng training FLOPs ít hơn khoảng 20 lần và không cần pretraining.

ModAR đạt tỷ lệ thành công trung bình cao nhất ở mọi quy mô dữ liệu được đánh giá so với các công thức WAM hiện có.

ModAR đạt tỷ lệ thành công trung bình quan sát được là 75% so với 72% của Flex-$\pi$.

ModAR sử dụng ít hơn khoảng 20times training FLOPs và không cần pretraining khi so sánh với Flex-$\pi$.

taesiri · 15 thg 9, 2026 đọc bản gốc ↗
↑