OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
Les auteurs présentent OneStreamer, une approche qui apprend conjointement l'enregistrement de preuves indépendantes des requêtes et la réponse aux tâches grâce à une génération proactive pour la vidéo en continu. Il utilise Proactive Hierarchical Caption Memory (PHCM) pour produire des légendes de détails locaux et des résumés d'événements. Combiné avec le dataset OneStreamer-1M contenant plus d'un million d'enregistrements, leur modèle 4B surpasse les autres méthodes sur huit benchmarks de compréhension vidéo en continu tout en supervisant seulement 27,5 % des tokens d'état annotés.
OneStreamer-1M est un ensemble de données d'interaction vidéo en continu à large couverture avec plus d'un million d'enregistrements couvrant diverses tâches.
Notre modèle 4B obtient les meilleurs résultats parmi les méthodes comparées sur les huit benchmarks d'évaluation de la compréhension vidéo en continu.
PSTL surpasse également la supervision d'état dense tout en supervisant seulement 27,5 % des tokens d'état annotés.