I Have a Stream: Making Self-Supervised Learning Work on Continuous Video
Các phương pháp học tự giám sát truyền thống thường lấy mẫu độc lập và xáo trộn toàn cục các khung hình qua các epoch, khác biệt hoàn toàn với việc tiếp nhận video liên tục ngoài đời thực. Nghiên cứu này nghiên cứu học tự giám sát từ các luồng video liên tục bằng cách sử dụng các batch theo cửa sổ trượt nghiêm ngặt mà không xáo trộn toàn cục. Tác giả xây dựng WT++, một tập dữ liệu đi bộ đô thị dài 95 giờ, và phát hiện ra rằng thách thức chính là sự tương đồng nội bộ cao giữa các khung hình gần giống nhau trong cùng một batch. Để khắc phục, phương pháp StreamMAE được đề xuất, kết hợp điều tiết nhận biết luồng và lựa chọn vùng cắt chệch chuyển động, giúp vượt qua các baseline dạng streaming và đạt hiệu suất tương đương MAE học độc lập.
WT++ là một 95-hour urban walking-tour video dataset được xây dựng để streaming pretraining.
StreamMAE áp dụng stream-aware regularization và motion-biased crop selection để giảm intra-batch similarity.
Phương pháp mở rộng quy mô tích cực (scales positively) khi pretraining stream tăng từ 12 lên 95 hours.