PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
L'article présente PhysBrain 1.5, un modèle unifié pour comprendre les environnements physiques, générer des actions et prédire les états futurs. Partant d'un modèle vision-langage général, il encode le langage, les mouvements d'effecteurs et les cibles visuelles en séquences discrètes optimisées par prédiction autorégressive du token suivant. Le pré-entraînement s'appuie sur des vidéos d'interaction humaine, suivies d'un fine-tuning sur des démonstrations et des trajectoires de robots. Avec un score moyen de 72,5 sur 28 benchmarks, le modèle 8B établit un nouvel état de l'art open source.
Notre modèle de 8B atteint un score moyen de 72,5 sur 28 benchmarks de compréhension incarnée.
Il obtient les meilleurs résultats open source sur 14 benchmarks tout en conservant des capacités multimodales générales.
Il produit des trajectoires d'effecteurs terminaux et prédit des scènes futures grâce à des sorties RGB, de profondeur et de masques de robot alignées dans l'espace.