CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 11 votes

SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

QUESTION — Comment concevoir des tokeniseurs de scène pour obtenir des sémantiques prédictibles et une fidélité vidéo élevée dans la génération autorégressive ?

Ce travail aborde les limites des tokeniseurs flexibles qui n'appliquent la perte d'alignement que sur les états cachés précoces du décodeur. Les auteurs introduisent SemanTok, un tokeniseur vidéo flexible qui alimente son encodeur avec des caractéristiques DINO gelées et ajoute des têtes légères pour les reconstruire à partir de chaque préfixe de token retenu. Les résultats expérimentaux démontrent qu'un modèle SemanTok AR de 201M égale ou surpasse un modèle VideoFlexTok AR d'une taille supérieure de 3,4times, tout en maintenant un alignement sémantique élevé.

A 201M SemanTok AR model matches or beats a VideoFlexTok AR model 3.4times its size.

mboss · 30 sept. 2026 lire l'original ↗
↑