CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 12 votes

MemBodied: Recurrent Associative Memory for Vision-Language-Action Models

QUESTION — Comment fournir une mémoire épisodique à long terme aux modèles Vision-Language-Action sans alourdir le contexte ni augmenter la latence d'inférence ?

L'article présente MemBodied, une mémoire épisodique de taille fixe comprenant deux composants complémentaires : un état associatif enregistrant les interactions entre les appels de politique et un ancrage d'épisode préservant une représentation compacte de la scène initiale. Au lieu de gonfler le contexte avec des observations passées brutes, le modèle conditionne la génération d'actions sur les entrées actuelles et ces composants de mémoire. Des expériences sur les tâches RMBench et LIBERO-Long démontrent que MemBodied améliore considérablement les taux de réussite par rapport aux politiques sans état et aux mémoires récurrentes de base, tout en ajoutant très peu de paramètres.

MemBodied atteint 7,81 fois le taux de réussite moyen d'une politique sans état et 2,98 fois celui d'une mémoire récurrente de base à travers cinq tâches RMBench évaluées.

Il surpasse la référence augmentée par la mémoire la plus forte de 1,3 fois avec 10 fois moins de paramètres ajoutés.

Sur la suite entièrement observable LIBERO-Long, il a atteint 90,6 %, soit une amélioration de 5,4 % par rapport à la politique π_0 sans état.

soujanyaporia · 23 sept. 2026 lire l'original ↗
↑