StableVQ: Practical Guidelines for Stable Vector-Quantized Tokenizer Training
L'article souligne que l'instabilité d'entraînement dans les tokenizeurs visuels discrets vector-quantized (VQ) provient de l'intrication de l'entraînement de l'Encoder-Decoder et du Codebook, où les modules ne parviennent pas à remplir leurs rôles de manière isolée. Les auteurs proposent StableVQ, comprenant trois composants : Dynamic STE pour corriger l'instabilité d'apprentissage de l'encodeur, Region VQ Loss pour reconcevoir l'objectif d'apprentissage du Codebook afin de suivre la distribution de sortie de l'encodeur indépendamment, et Decoupled Schedule pour attribuer des programmes de taux d'apprentissage indépendants à chaque module. StableVQ est léger et n'introduit aucun paramètre entraînable.
Construit sur des codebooks à projection partagée, StableVQ est léger et n'introduit aucun paramètre entraînable.
Des expériences sur ImageNet démontrent des améliorations cohérentes de la stabilité de l'entraînement, de l'utilisation du codebook et de la qualité de reconstruction à travers diverses tailles de codebook et configurations d'initialisation.