CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 7 upvote

World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal

CÂU HỎI — Làm thế nào để tích hợp các mô hình ngôn ngữ thị giác (VLM) vào không gian hành động trực quan nhằm điều khiển robot thao tác chính xác hơn?

Nghiên cứu giới thiệu World Action Agent (WAA), một hệ thống đa tác vụ giúp các mô hình ngôn ngữ thị giác (VLM) điều khiển robot thông qua không gian hành động trực quan bao gồm các góc nhìn tiếp xúc, diễn tập hành động và chỉnh sửa trong khung hình. WAA học kỹ năng đa phương thức từ video chuyên gia và tái sử dụng chúng bằng Skill Agent, đồng thời cho phép tinh chỉnh các VLM nhỏ hơn dựa trên vết tương tác của harness. Trên benchmark LIBERO-Pro, WAA đạt 75,6% tỷ lệ thành công trung bình khi sử dụng kỹ năng học từ LIBERO-90. Việc tinh chỉnh Qwen3.5-9B trên dữ liệu trace giúp nâng tỷ lệ thành công ngoài miền từ 1,7% lên 43,3%.

WAA với các kỹ năng tiến hóa từ LIBERO-90 đạt mức trung bình thành công 75,6% trên LIBERO-Pro.

Việc fine-tune Qwen3.5-9B trên các trace của harness làm tăng tỷ lệ thành công ngoài miền từ 1,7% lên 43,3%.

taesiri · 24 thg 9, 2026 đọc bản gốc ↗
↑