PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection
QUESTION — Comment les modèles vision-langage peuvent-ils réaliser du captioning ancré panoptique grâce à la sélection de propositions de masques ?
Cette étude examine le captioning ancré panoptique, une tâche exigeant qu'un modèle vision-langage (VLM) décrive les objets au premier plan et les zones d'arrière-plan tout en ancrant chaque expression référentielle avec des masques au niveau du pixel. Les auteurs introduisent PanoCaps, un benchmark annoté par l'humain, un protocole de correspondance phrase-masque et une métrique gPQ. Ils proposent PANORAMA, un VLM qui conditionne un segmenteur pré-entraîné sur des représentations de phrases contextualisées pour sélectionner des masques candidats, permettant d'obtenir des segmentations d'entités précises et des descriptions cohérentes.
HuggingSara · 16 sept. 2026
lire l'original ↗