SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation
QUESTION — Comment concevoir des tokeniseurs de scène pour obtenir des sémantiques prédictibles et une fidélité vidéo élevée dans la génération autorégressive ?
Ce travail aborde les limites des tokeniseurs flexibles qui n'appliquent la perte d'alignement que sur les états cachés précoces du décodeur. Les auteurs introduisent SemanTok, un tokeniseur vidéo flexible qui alimente son encodeur avec des caractéristiques DINO gelées et ajoute des têtes légères pour les reconstruire à partir de chaque préfixe de token retenu. Les résultats expérimentaux démontrent qu'un modèle SemanTok AR de 201M égale ou surpasse un modèle VideoFlexTok AR d'une taille supérieure de 3,4times, tout en maintenant un alignement sémantique élevé.
A 201M SemanTok AR model matches or beats a VideoFlexTok AR model 3.4times its size.
mboss · 30 sept. 2026
lire l'original ↗