World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal
Nghiên cứu giới thiệu World Action Agent (WAA), một hệ thống đa tác vụ giúp các mô hình ngôn ngữ thị giác (VLM) điều khiển robot thông qua không gian hành động trực quan bao gồm các góc nhìn tiếp xúc, diễn tập hành động và chỉnh sửa trong khung hình. WAA học kỹ năng đa phương thức từ video chuyên gia và tái sử dụng chúng bằng Skill Agent, đồng thời cho phép tinh chỉnh các VLM nhỏ hơn dựa trên vết tương tác của harness. Trên benchmark LIBERO-Pro, WAA đạt 75,6% tỷ lệ thành công trung bình khi sử dụng kỹ năng học từ LIBERO-90. Việc tinh chỉnh Qwen3.5-9B trên dữ liệu trace giúp nâng tỷ lệ thành công ngoài miền từ 1,7% lên 43,3%.
WAA với các kỹ năng tiến hóa từ LIBERO-90 đạt mức trung bình thành công 75,6% trên LIBERO-Pro.
Việc fine-tune Qwen3.5-9B trên các trace của harness làm tăng tỷ lệ thành công ngoài miền từ 1,7% lên 43,3%.