MemBodied: Recurrent Associative Memory for Vision-Language-Action Models
L'article présente MemBodied, une mémoire épisodique de taille fixe comprenant deux composants complémentaires : un état associatif enregistrant les interactions entre les appels de politique et un ancrage d'épisode préservant une représentation compacte de la scène initiale. Au lieu de gonfler le contexte avec des observations passées brutes, le modèle conditionne la génération d'actions sur les entrées actuelles et ces composants de mémoire. Des expériences sur les tâches RMBench et LIBERO-Long démontrent que MemBodied améliore considérablement les taux de réussite par rapport aux politiques sans état et aux mémoires récurrentes de base, tout en ajoutant très peu de paramètres.
MemBodied atteint 7,81 fois le taux de réussite moyen d'une politique sans état et 2,98 fois celui d'une mémoire récurrente de base à travers cinq tâches RMBench évaluées.
Il surpasse la référence augmentée par la mémoire la plus forte de 1,3 fois avec 10 fois moins de paramètres ajoutés.
Sur la suite entièrement observable LIBERO-Long, il a atteint 90,6 %, soit une amélioration de 5,4 % par rapport à la politique π_0 sans état.