Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes
Nhóm tác giả giới thiệu Where-OPD, một phương pháp on-policy self-distillation dành cho các multimodal large language models, cung cấp cho teacher hướng dẫn không gian được neo văn bản để xác định các yếu tố trực quan liên quan đến truy vấn. Họ sử dụng các cảnh được tạo ra theo thủ tục với danh tính đối tượng và tọa độ không gian tự động, cho phép post-training có khả năng mở rộng mà không cần gán nhãn dữ liệu thủ công. Teacher sử dụng hướng dẫn không gian này để định vị và tích hợp bằng chứng từ nhiều vùng ảnh liên quan, trong khi student học cách tái tạo lại hành vi đó chỉ từ ảnh và câu hỏi. Phương pháp này mang lại hiệu suất vượt trội trên các benchmark đếm, tài liệu và hiểu biểu đồ, đồng thời chuyển giao hiệu quả sang các benchmark thế giới thực.
Sử dụng các cảnh được tạo ra theo thủ tục với tọa độ không gian tự động để post-training không cần gán nhãn.
Cải thiện hiệu suất trên các benchmark đếm, tài liệu và hiểu biểu đồ cho nhiều mô hình khác nhau.
Mang lại mức tăng 3,23 điểm trong hiệu suất trung bình trên CVBench, V*, ZoomBench, BLINK, HR-Bench và MME-RealWorld.