What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling
Các tác giả đã nghiên cứu lý do tại sao các latent WAMs (bỏ qua việc sinh tương lai trong quá trình suy luận) lại thất bại trong việc giữ lại các lợi ích tổng quát hóa mặc dù khớp với các explicit WAMs trên các tác vụ trong phân phối. Họ phát hiện ra rằng khoảng cách này xuất phát từ bước khử nhiễu đầu tiên, nghĩa là lợi ích đến từ việc chuẩn bị cho tương lai chứ không phải tạo ra nó. Do đó, họ đề xuất Simple-WAM, đơn giản hóa mô hình hóa tương lai thành một lần chạy chuyển tiếp duy nhất với các token video bị nhiễu hoàn toàn và điều chỉnh lịch trình nhiễu. Phương pháp này mang lại hiệu suất tổng quát hóa dẫn đầu các explicit WAMs với hiệu quả tương đương latent WAMs trên các tác vụ mô phỏng và thực tế.
Latent WAMs không giữ được lợi ích tổng quát hóa mặc dù khớp với explicit WAMs trên các tác vụ trong phân phối.
Khoảng cách hiệu suất xuất phát gần như hoàn toàn từ bước khử nhiễu đầu tiên.
Simple-WAM đạt hiệu suất tổng quát hóa dẫn đầu các explicit WAMs với hiệu quả tương đương latent WAMs.