CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 46 upvote

Beyond the Current Scene: Event-Referential Grasping with Active View Selection

CÂU HỎI — Làm thế nào một robot có thể lấy được một mục tiêu được tham chiếu theo sự kiện khi nó bị che khuất hoặc không còn hiển thị?

Họ giới thiệu BeyondSCe, một hệ thống nắm bắt robot zero-shot xử lý các yêu cầu chỉ định mục tiêu theo vai trò của nó trong một sự kiện quá khứ chứ không phải bằng tên hoặc hình ảnh. Khi mục tiêu bị che khuất, hệ thống kết hợp thông tin lịch sử sự kiện với hình học cảnh hiện tại để chọn các góc máy quay có khả năng làm lộ mục tiêu nhất. Sử dụng các mô hình pretrained mà không cần huấn luyện bổ sung, hệ thống đạt tỷ lệ thành công khi nắm bắt là 76% cho các mục tiêu hiển thị ban đầu và 77% cho các mục tiêu bị che khuất, đồng thời cải thiện tỷ lệ thành công từ 75% lên 95% trên các cảnh bị che khuất nặng trong khi giảm số lượng góc nhìn trung bình từ 3.35 xuống 2.20.

Đạt tỷ lệ thành công khi nắm bắt lần lượt là 76% và 77% cho các mục tiêu hiển thị ban đầu và bị che khuất.

Cải thiện tỷ lệ thành công từ 75% lên 95% trên bốn cảnh có độ che khuất nặng.

Giảm số lượng góc nhìn trung bình từ 3.35 xuống 2.20 so với phương pháp baseline.

b1o1o1m · 30 thg 9, 2026 đọc bản gốc ↗
↑