PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection
CÂU HỎI — Làm thế nào để các mô hình ngôn ngữ thị giác thực hiện gán nhãn toàn cảnh có căn cứ bằng cách lựa chọn đề xuất mặt nạ?
Nghiên cứu này giải quyết bài toán panoptic grounded captioning, yêu cầu mô hình ngôn ngữ thị giác (VLM) mô tả cả đối tượng tiền cảnh lẫn vùng hậu cảnh đồng thời gắn mỗi cụm từ tham chiếu với các mặt nạ cấp độ pixel. Các tác giả giới thiệu benchmark PanoCaps, đề xuất giao thức matching cụm từ-mặt nạ mới cùng độ đo gPQ, và xây dựng PANORAMA—một VLM định hướng một bộ phân đoạn có sẵn thông qua biểu diễn cụm từ theo ngữ cảnh để lựa chọn mặt nạ tương ứng. Việc huấn luyện chung giao diện này với quá trình sinh caption giúp tạo ra các phân đoạn entity chính xác và các caption nhất quán.
HuggingSara · 16 thg 9, 2026
đọc bản gốc ↗