CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 32 votes

Region-Level Policy Optimization for Fine-grained MLLM Perception

QUESTION — Comment optimiser un réseau de propositions avec un apprentissage par renforcement au niveau des régions pour améliorer la perception visuelle fine dans les MLLM sans gonfler les coûts de jetons?

Cette recherche montre que la localisation de la région d'intérêt (RoI) et la reconnaissance du contenu dans les MLLM ont des exigences de résolution différentes, la localisation tolérant une compression de jetons environ 3 à 4 fois plus forte. Pour optimiser le réseau de propositions sans annotations de région, les auteurs présentent Vision-RL2, une méthode d'apprentissage par renforcement au niveau des régions. Un lecteur MLLM gelé note chaque région selon la façon dont sa suppression modifie la probabilité de réponse. Cela affine le prédécesseur pour activer un encodage sparse tout en excluant les jetons d'arrière-plan. Sur six benchmarks, Vision-RL2 améliore la précision en utilisant environ 4 fois moins de jetons visuels.

Vision-RL2 améliore la précision par rapport au modèle de base à chaque budget de jetons et dépasse sa précision au plus grand budget avec environ 4 fois moins de jetons visuels.

YuhengSSS · 17 sept. 2026 lire l'original ↗
↑