CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 202 votes

OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction

QUESTION — Comment maintenir une mémoire factuelle réutilisable dans l'interaction vidéo en continu sans compromettre la perception en temps réel ?

Les auteurs présentent OneStreamer, une approche qui apprend conjointement l'enregistrement de preuves indépendantes des requêtes et la réponse aux tâches grâce à une génération proactive pour la vidéo en continu. Il utilise Proactive Hierarchical Caption Memory (PHCM) pour produire des légendes de détails locaux et des résumés d'événements. Combiné avec le dataset OneStreamer-1M contenant plus d'un million d'enregistrements, leur modèle 4B surpasse les autres méthodes sur huit benchmarks de compréhension vidéo en continu tout en supervisant seulement 27,5 % des tokens d'état annotés.

OneStreamer-1M est un ensemble de données d'interaction vidéo en continu à large couverture avec plus d'un million d'enregistrements couvrant diverses tâches.

Notre modèle 4B obtient les meilleurs résultats parmi les méthodes comparées sur les huit benchmarks d'évaluation de la compréhension vidéo en continu.

PSTL surpasse également la supervision d'état dense tout en supervisant seulement 27,5 % des tokens d'état annotés.

Lanxingxuan · 01 oct. 2026 lire l'original ↗
↑