Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models
Les auteurs étudient l'optimisation des grands modèles de langage multimodaux (MLLM) en effectuant des interventions de rang faible sur le flux d'informations visuelles vers textuelles. Constatant que l'influence visuelle pertinente se concentre dans un sous-espace de faible dimension et que les états visuels spécifiques aux couches peuvent être approchés par des MLP légers, ils proposent δ-Vision. Cette méthode remplace l'évolution répétée des tokens visuels par le Transformer par des adaptateurs légers de rang faible qui construisent des mémoires visuelles par couche tout en préservant tous les tokens visuels.
La restauration de quelques directions seulement après le blocage de l'attention visuelle-textuelle récupère la majeure partie de la précision perdue.
Des MLP légers approximent les états visuels spécifiques aux couches avec une similarité cosinus élevée et une faible erreur de reconstruction.
δ-Vision atteint une précision supérieure aux méthodes de base d'élagage des tokens visuels à calcul comparable ou inférieur.