Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
Nghiên cứu này trình bày Dynin-Robotics, một mô hình khuếch tán mặt nạ omnimodal kết hợp dự đoán mục tiêu trực quan và trạng thái động lực học vào trong việc sinh hành động của robot. Bằng cách thay đổi điều kiện và khoảng mục tiêu, mô hình duy nhất này có thể thực hiện dự đoán hành động, dự đoán quan sát tiếp theo, dự đoán trạng thái mục tiêu cuối cùng và tái tạo quỹ đạo thành hướng dẫn. Được huấn luyện trước trên khoảng 1.33 triệu quỹ đạo, hệ thống đạt tỷ lệ thành công trung bình 78.4% trên robot Franka Research 3 và tăng tốc độ giải mã hành động lên tới 29.2x nhờ phương pháp song song khối.
Được huấn luyện trước liên tục trên khoảng 1.33 triệu quỹ đạo từ 48 tập dữ liệu Open X-Embodiment.
Đạt tỷ lệ thành công trung bình 78.4% qua bốn điều kiện thao tác trên robot Franka Research 3.
Tăng tốc giải mã hành động phía mô hình lên tới 29.2x so với cài đặt cơ sở.