CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 170 upvote

PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models

CÂU HỎI — Làm thế nào để chuyển đổi một mô hình ngôn ngữ thị giác (VLM) thành nền tảng vật lý có khả năng thấu hiểu môi trường và tạo ra hành động thực tế?

Bài báo giới thiệu PhysBrain 1.5, một mô hình hợp nhất giúp hiểu môi trường vật lý, sinh hành động và dự đoán trạng thái tương lai. Khởi đầu từ một VLM tổng quát, hệ thống mã hóa phản hồi ngôn ngữ, chuyển động cơ cấu chấp hành và mục tiêu thị giác thành các chuỗi rời rạc để tối ưu hóa đồng thời bằng dự đoán token kế tiếp tự hồi quy. Tiền huấn luyện dựa hoàn toàn vào video tương tác của con người, sau đó được tinh chỉnh trên các bản demo và quỹ đạo robot. Mô hình 8B đạt điểm trung bình 72.5 trên 28 benchmark hiểu không gian thực tế.

Mô hình 8B đạt điểm trung bình 72.5 trên 28 benchmark hiểu biết thể hiện (embodied understanding).

Đạt kết quả mã nguồn mở tốt nhất trên 14 benchmark trong khi vẫn giữ lại khả năng đa phương thức tổng quát.

Cung cấp khả năng tạo ra quỹ đạo đầu mút (end-effector) và dự đoán cảnh tương lai thông qua các đầu ra RGB, độ sâu và mặt nạ robot đồng bộ không gian.

VLyb · 14 thg 9, 2026 đọc bản gốc ↗
↑