CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 14 votes

The Low-Rank Structure of VLA Reinforcement Learning

QUESTION — Quelles structures de paramètres au sein des modèles vision-langage-action sont responsables des gains de performance lors du post-entraînement par apprentissage par renforcement ?

Cette étude examine comment l'apprentissage par renforcement (RL) remodèle les politiques dans les modèles vision-langage-action (VLA). Les auteurs découvrent que le RL induit des mises à jour de paramètres de rang faible hautement concentrées dans les modules Timestep de l'expert en action à travers des modèles tels que $\pi_{0.5}$ et GR00T N1.5/N1.6. Grâce à des expériences systématiques de remplacement de modules, ils montrent que ces modules captent une part disproportionnée des gains de performance du RL. De plus, les directions de mise à jour du décalage prédisent fortement le succès des tâches avec un ROC-AUC allant jusqu'à 99,6 %, permettant d'améliorer les politiques entraînées sans entraînement RL supplémentaire.

Le RL induit des mises à jour de paramètres de rang faible concentrées dans les modules Timestep de l'expert en action.

Les directions de mise à jour du décalage prédisent fortement le succès de la tâche avec un ROC-AUC allant jusqu'à 99,6 %.

Jongwondd · 28 sept. 2026 lire l'original ↗
↑