CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 2 votes

X-Planner: Event-Structured Task Planning for Embodied Intelligence

QUESTION — Comment améliorer la structure intermédiaire et la supervision dans la planification de tâches à long horizon pour les systèmes Vision-Language-Action ?

Les auteurs présentent X-Planner, un frontal de planification pour les systèmes Vision-Language-Action (VLA) qui résout le manque de structures intermédiaires explicites dans la manipulation à long horizon. X-Planner combine des données Ego, UMI et de téléopération avec une granularité hiérarchique, supervisée par des annotations de temps de reprise et des échecs conçus par l'homme. L'architecture utilise un tronc commun VLM exposant deux formes de plans structurés par événements : une interface discrète pour les états d'événements interprétables et une interface latente transmettant des états de chaîne de pensée continus à travers les profondeurs du Transformeur via le Staircase Decoding. Les évaluations hors ligne placent X-Planner en deuxième position parmi quatre modèles sur le BERTScore-F1 et le score global attribué par un juge.

L'évaluation de la planification hors ligne en deux étapes place X-Planner en deuxième position parmi quatre modèles évalués sur le BERTScore-F1 et le score global basé sur un juge.

wisdompan · 21 sept. 2026 lire l'original ↗
↑