CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 11 votes

Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies

QUESTION — Comment distiller les représentations du monde physique d'un modèle du monde dans des politiques Vision-Language-Action compactes sans ajouter de latence d'inférence à l'exécution ?

Ce travail propose de distiller les représentations internes d'un modèle du monde figé dans des politiques Vision-Language-Action (VLA) compactes en ajoutant un seul terme d'alignement des caractéristiques pendant l'entraînement. Une fois entraîné, le projecteur est supprimé, laissant la politique déployée identique à la base non distillée tout en héritant d'un ancrage physique. Fonctionnant en 32 ms sur une RTX 5090, un modèle étudiant de 0,8B atteint de hautes performances sur LIBERO et améliore les tâches de manipulation sur RoboCasa-GR1.

La politique déployée s'exécute en 32 ms et 1,86 Go sur une RTX 5090 grand public, identique à la base non distillée.

Un étudiant de 0,8B atteint 97,9 % sur LIBERO.

Il s'améliore de 48,2 % à 50,5 % sur la manipulation humanoïde RoboCasa-GR1.

termanteus · 21 sept. 2026 lire l'original ↗
↑