InternW0-Δ: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data
CÂU HỎI — Làm thế nào để tích hợp các thông tin tiền huấn luyện quy mô lớn về động lực học hình ảnh, ngữ cảnh và hình học vào một mô hình tác động thế giới thống nhất cho robot thao tác?
Các tác giả giới thiệu InternW0-Δ, một World Action Model (WAM) kết hợp động lực học hình ảnh, ngữ cảnh, hình học 4D và khả năng sinh hành động thông qua kiến trúc Mixture-of-Transformers (MoT). Hệ thống sử dụng một video expert và một action expert tương tác dưới sự hướng dẫn ngữ cảnh của một VLM bị đóng băng, kết hợp phương pháp Causal Imprint để truyền các thay đổi cảnh quan trọng trong tương lai trực tiếp cho action expert mà không cần suy luận cuộn video tương lai. Họ đã huấn luyện mô hình trên một tập dữ liệu dị thể chứa hơn 20K giờ dữ liệu đã xử lý.
The resulting corpus contains over 20K hours of processed training data, to our knowledge the largest open-source corpus of its kind.
taesiri · 25 thg 9, 2026
đọc bản gốc ↗