CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 17 votes

PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection

QUESTION — Comment les modèles vision-langage peuvent-ils réaliser du captioning ancré panoptique grâce à la sélection de propositions de masques ?

Cette étude examine le captioning ancré panoptique, une tâche exigeant qu'un modèle vision-langage (VLM) décrive les objets au premier plan et les zones d'arrière-plan tout en ancrant chaque expression référentielle avec des masques au niveau du pixel. Les auteurs introduisent PanoCaps, un benchmark annoté par l'humain, un protocole de correspondance phrase-masque et une métrique gPQ. Ils proposent PANORAMA, un VLM qui conditionne un segmenteur pré-entraîné sur des représentations de phrases contextualisées pour sélectionner des masques candidats, permettant d'obtenir des segmentations d'entités précises et des descriptions cohérentes.

HuggingSara · 16 sept. 2026 lire l'original ↗
↑