SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation
CÂU HỎI — Làm thế nào để cải thiện tính dự đoán và ngữ nghĩa của token trong các mô hình tạo video tự hồi quy quy mô lớn?
Công trình này giải quyết hạn chế của các bộ chuyển đổi token linh hoạt hiện tại vốn chỉ áp dụng hàm mất mát REPA trên các trạng thái ẩn giai đoạn đầu của bộ giải mã. Các tác giả giới thiệu SemanTok, một trình tạo token video linh hoạt đưa các đặc trưng DINO đã đóng băng (frozen) vào encoder và bổ sung các đầu nhẹ để tái tạo chúng từ mỗi tiền tố token được giữ lại. Kết quả thực nghiệm cho thấy mô hình SemanTok AR với 201M tham số có thể bắt kịp hoặc vượt qua mô hình VideoFlexTok AR có kích thước lớn gấp 3,4 lần, đồng thời cải thiện độ trung thực và căn chỉnh ngữ nghĩa ở mọi mức độ nhiễu.
A 201M SemanTok AR model matches or beats a VideoFlexTok AR model 3.4times its size.
mboss · 30 thg 9, 2026
đọc bản gốc ↗