Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes
Les auteurs présentent Where-OPD, une méthode d'auto-distillation on-policy pour les grands modèles de langage multimodaux qui fournit au teacher un guidage ancré textuellement et spatialement identifiant les éléments visuels pertinents pour une requête. Ils utilisent des scènes générées procéduralement avec des identités d'objets et des coordonnées spatiales disponibles automatiquement, permettant un post-entraînement évolutif et sans annotation. Le teacher utilise ce guidage spatial pour localiser et intégrer des preuves provenant de plusieurs régions d'image pertinentes, tandis que le student apprend à reproduire le comportement résultant à partir de l'image et de la question seules. Cette approche améliore les performances sur les benchmarks de comptage, de documents et de compréhension de graphiques tout en se transférant avec succès aux benchmarks du monde réel.
Des scènes générées procéduralement avec des identités d'objets et des coordonnées spatiales disponibles automatiquement permettent un post-entraînement évolutif et sans annotation.
Les performances s'améliorent de manière cohérente sur les benchmarks de comptage, de documents et de compréhension de graphiques à travers plusieurs modèles.
Génère un gain de 3,23 points de performance moyenne sur CVBench, V*, ZoomBench, BLINK, HR-Bench et MME-RealWorld.