CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 12 votes

Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models

QUESTION — Peut-on préserver tous les tokens visuels dans les MLLM tout en réduisant le coût de calcul lié à l'évolution répétée des représentations à travers le Transformer ?

Les auteurs étudient l'optimisation des grands modèles de langage multimodaux (MLLM) en effectuant des interventions de rang faible sur le flux d'informations visuelles vers textuelles. Constatant que l'influence visuelle pertinente se concentre dans un sous-espace de faible dimension et que les états visuels spécifiques aux couches peuvent être approchés par des MLP légers, ils proposent δ-Vision. Cette méthode remplace l'évolution répétée des tokens visuels par le Transformer par des adaptateurs légers de rang faible qui construisent des mémoires visuelles par couche tout en préservant tous les tokens visuels.

La restauration de quelques directions seulement après le blocage de l'attention visuelle-textuelle récupère la majeure partie de la précision perdue.

Des MLP légers approximent les états visuels spécifiques aux couches avec une similarité cosinus élevée et une faible erreur de reconstruction.

δ-Vision atteint une précision supérieure aux méthodes de base d'élagage des tokens visuels à calcul comparable ou inférieur.

huaXiaKyrie · 28 sept. 2026 lire l'original ↗
↑