CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 148 upvote

WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

CÂU HỎI — Làm thế nào để duy trì tính nhất quán dài hạn và độ chính xác điều khiển camera trong các mô hình thế giới video?

Các tác giả giới thiệu WorldCrafter, một mô hình thế giới video tích hợp bộ nhớ ngầm nhận thức không gian 3D có thể truy vấn bằng camera để xử lý việc quan sát trong thời gian dài. Hệ thống sử dụng một bộ mã hóa bộ nhớ và mô-đun đọc có điều kiện tư thế để tổng hợp các quan sát lịch sử thành các token mục tiêu cố định trước quá trình khử nhiễu. Bằng cách kết hợp bộ nhớ này với ngữ cảnh tạm thời và phương pháp chưng cất vài bước, mô hình hỗ trợ khám phá cảnh phát trực tuyến từ một hình ảnh duy nhất hoặc câu lệnh văn bản.

WorldCrafter học một bộ nhớ ngầm nhận thức 3D có thể truy vấn bằng camera để cải thiện tính nhất quán dài hạn.

Drexubery · 21 thg 9, 2026 đọc bản gốc ↗
↑