CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 18 votes

InternW0-Δ: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data

QUESTION — Comment unifier des a priori pré-entraînés à grande échelle de dynamique visuelle, de sémantique de scène et de géométrie dans un modèle d'action robotique généraliste ?

Les auteurs présentent InternW0-Δ, un modèle d'action mondial (WAM) qui combine la dynamique visuelle, la sémantique, la géométrie 4D et la génération d'actions via une architecture Mixture-of-Transformers (MoT). Il utilise un expert vidéo et un expert en action interagissant sous la guidance sémantique d'un VLM gelé, ainsi que le mécanisme Causal Imprint pour fournir des changements de scène futurs directement à l'expert en action sans déploiement vidéo futur lors de l'inférence. Le modèle est pré-entraîné sur un corpus hétérogène contenant plus de 20K heures de données d'entraînement traitées.

The resulting corpus contains over 20K hours of processed training data, to our knowledge the largest open-source corpus of its kind.

taesiri · 25 sept. 2026 lire l'original ↗
↑