I Have a Stream: Making Self-Supervised Learning Work on Continuous Video
Les pipelines d'apprentissage autosupervisé standard échantillonnent les images indépendamment et les mélangent globalement. Les auteurs étudient l'apprentissage autosupervisé à partir de flux vidéo continus en utilisant des lots à fenêtre glissante stricte sans réajustement global. Ils construisent WT++, un ensemble de données vidéo de visites urbaines de 95 heures pour le pré-entraînement en flux. En évaluant diverses méthodes, ils identifient la forte similarité intra-lot comme le principal défi. Pour y remédier, ils proposent StreamMAE, qui adapte le pipeline d'entrée avec une régularisation consciente du flux et une sélection de recadrage biaisée par le mouvement. StreamMAE surpasse les bases de référence en continu, égale le MAE i.i.d. et s'adapte positivement à mesure que le flux passe de 12 à 95 heures.
WT++ est un ensemble de données vidéo de 95 heures construit pour le pré-entraînement en flux.
StreamMAE adapte le pipeline d'entrée avec une régularisation consciente du flux et une sélection de recadrage biaisée par le mouvement.
Il évolue positivement à mesure que le flux de pré-entraînement passe de 12 à 95 heures.