CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 63 upvote

MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation

CÂU HỎI — Liệu một general-purpose VLM có thể điều khiển robot trực tiếp từ quan sát mà không cần đến các action expert hay công cụ phụ trợ không?

Nghiên cứu giới thiệu MotorMind, một robot manipulation harness kết nối các hành động trung gian do VLM đề xuất với cơ chế điều khiển robot tất định và phản hồi bất đồng bộ. Hệ thống cho phép VLM tổng quát hoạt động như một toán tử con người mà không cần huấn luyện policy chuyên biệt, coding agent hay công cụ hỗ trợ như SAM3. Kết quả thực nghiệm trên các bộ LIBERO-PRO cho thấy MotorMind đạt độ chính xác cao, đồng thời duy trì độ ổn định tốt khi có các yếu tố nhiễu động từ con người hoặc môi trường thực tế trên robot xArm6.

MotorMind đạt 66.7% success trên các bộ cơ sở LIBERO-PRO và 53.8% trong điều kiện có nhiễu loạn.

Giao diện tương tự đạt trung bình 95% success trên robot xArm6 thực tế qua các thiết lập thao tác trực tiếp và nhiễu loạn từ con người.

bx6d · 29 thg 9, 2026 đọc bản gốc ↗
↑