CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 87 upvote

Grounded Action Model: 3D Grounding as a Foundation for Robotics

CÂU HỎI — Làm thế nào để tích hợp khả năng căn cứ 3D vào các mô hình nền tảng robot nhằm cải thiện tác vụ thao tác?

Bài báo đề xuất Grounded Action Models (GAM), một mô hình nền tảng robot mới tích hợp khả năng căn cứ 3D (3D grounding) từ đầu. GAM chuyển đổi các gợi ý ngôn ngữ, điểm hoặc hộp thành một biểu diễn hướng đối tượng chung, kết hợp các đặc trưng thị giác tập trung vào mục tiêu và hình học đối tượng với lịch sử trạng thái robot thông qua một transformer đa luồng để dự đoán các chuỗi hành động. Thử nghiệm trên RoboTwin 2.0 và LIBERO-PRO cho thấy GAM đạt tỷ lệ thành công vượt trội so với các baseline trong cả điều kiện bình thường lẫn khi có xáo trộn cảnh quan hoặc chuyển dịch hình ảnh.

GAM achieves an average success rate of 55.3% across 50 tasks (vs. 52.0% for Spatial Forcing).

47.6% under scene randomization (vs. 30.4% for Abot-M0).

achieves a state-of-the-art average success rate of 61% (vs. 53% for π_{0.5}) across 16 perturbation settings.

Jiafei1224 · 20 thg 9, 2026 đọc bản gốc ↗
↑