CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 77 upvote

World Observer: Joint Actor-Observer Generation for Persistent World Modeling

CÂU HỎI — How can video world models continuously simulate regions outside an agent's current perspective view?

Bài báo giới thiệu World Observer, một phương pháp tách biệt việc quan sát và hành động để giải quyết vấn đề mô hình thế giới video thường mất dấu các đối tượng khi chúng rời khỏi tầm nhìn của tác nhân. Hệ thống này sinh đồng thời một góc nhìn tác nhân hướng đến đối tượng cùng với một hoặc nhiều góc nhìn quan sát toàn cảnh theo dõi các vùng khác nhau trong không gian. Bằng cách sử dụng nguồn toàn cảnh chia sẻ và Observer Sink để khôi phục hình ảnh độ phân giải cao khi đối tượng quay trở lại, phương pháp này duy trì sự tiến hóa trực quan của các đối tượng ngoài tầm nhìn mà vẫn cạnh tranh tốt về độ trung thực hình ảnh và điều khiển camera.

World Observer tách biệt việc quan sát khỏi hành động bằng cách kết hợp góc nhìn tác nhân với các quan sát viên toàn cảnh.

Phương pháp sử dụng Observer Sink để khôi phục diện mạo chi tiết khi đối tượng quay trở lại tầm nhìn.

Mô hình cải thiện đáng kể động lực học ngoài tầm nhìn trong khi vẫn duy trì độ trung thực hình ảnh cạnh tranh.

enrue1893 · 01 thg 10, 2026 đọc bản gốc ↗
↑