The Low-Rank Structure of VLA Reinforcement Learning
Cette étude examine comment l'apprentissage par renforcement (RL) remodèle les politiques dans les modèles vision-langage-action (VLA). Les auteurs découvrent que le RL induit des mises à jour de paramètres de rang faible hautement concentrées dans les modules Timestep de l'expert en action à travers des modèles tels que $\pi_{0.5}$ et GR00T N1.5/N1.6. Grâce à des expériences systématiques de remplacement de modules, ils montrent que ces modules captent une part disproportionnée des gains de performance du RL. De plus, les directions de mise à jour du décalage prédisent fortement le succès des tâches avec un ROC-AUC allant jusqu'à 99,6 %, permettant d'améliorer les politiques entraînées sans entraînement RL supplémentaire.
Le RL induit des mises à jour de paramètres de rang faible concentrées dans les modules Timestep de l'expert en action.
Les directions de mise à jour du décalage prédisent fortement le succès de la tâche avec un ROC-AUC allant jusqu'à 99,6 %.