CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 25 votes

LoopVL: Recurrent Visual Intelligence

QUESTION — Les Loop Transformers peuvent-ils être étendus efficacement aux modèles vision-langage pour le calcul récurrent ?

Les auteurs présentent LoopVL pour étudier l'extension des Loop Transformers aux modèles vision-langage. LoopVL combine un calcul de type Module-Loop et Model-Loop pour mettre à jour de manière itérative un état vision-langage unifié via des modules partagés. Entraîné à partir de zéro par pré-entraînement linguistique, entraînement multimodal et post-entraînement, LoopVL surpasse une gamme de modèles non récurrents de taille similaire ou supérieure sur les benchmarks de compréhension multimodale et de raisonnement visuel. De plus, le modèle présente des Visual Aha Moments caractérisés par des changements prononcés de l'attention visuelle à travers les boucles.

Gtime666 · 29 sept. 2026 lire l'original ↗
↑