CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 170 votes

PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models

QUESTION — Comment transformer un modèle vision-langage en un modèle de fondation physique unifié capable de comprendre l'environnement et de générer des actions ?

L'article présente PhysBrain 1.5, un modèle unifié pour comprendre les environnements physiques, générer des actions et prédire les états futurs. Partant d'un modèle vision-langage général, il encode le langage, les mouvements d'effecteurs et les cibles visuelles en séquences discrètes optimisées par prédiction autorégressive du token suivant. Le pré-entraînement s'appuie sur des vidéos d'interaction humaine, suivies d'un fine-tuning sur des démonstrations et des trajectoires de robots. Avec un score moyen de 72,5 sur 28 benchmarks, le modèle 8B établit un nouvel état de l'art open source.

Notre modèle de 8B atteint un score moyen de 72,5 sur 28 benchmarks de compréhension incarnée.

Il obtient les meilleurs résultats open source sur 14 benchmarks tout en conservant des capacités multimodales générales.

Il produit des trajectoires d'effecteurs terminaux et prédit des scènes futures grâce à des sorties RGB, de profondeur et de masques de robot alignées dans l'espace.

VLyb · 14 sept. 2026 lire l'original ↗
↑