CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 55 votes

StableVQ: Practical Guidelines for Stable Vector-Quantized Tokenizer Training

QUESTION — Quelle est la cause racine de l'instabilité d'entraînement dans les tokenizeurs vector-quantized (VQ) et comment peut-elle être résolue ?

L'article souligne que l'instabilité d'entraînement dans les tokenizeurs visuels discrets vector-quantized (VQ) provient de l'intrication de l'entraînement de l'Encoder-Decoder et du Codebook, où les modules ne parviennent pas à remplir leurs rôles de manière isolée. Les auteurs proposent StableVQ, comprenant trois composants : Dynamic STE pour corriger l'instabilité d'apprentissage de l'encodeur, Region VQ Loss pour reconcevoir l'objectif d'apprentissage du Codebook afin de suivre la distribution de sortie de l'encodeur indépendamment, et Decoupled Schedule pour attribuer des programmes de taux d'apprentissage indépendants à chaque module. StableVQ est léger et n'introduit aucun paramètre entraînable.

Construit sur des codebooks à projection partagée, StableVQ est léger et n'introduit aucun paramètre entraînable.

Des expériences sur ImageNet démontrent des améliorations cohérentes de la stabilité de l'entraînement, de l'utilisation du codebook et de la qualité de reconstruction à travers diverses tailles de codebook et configurations d'initialisation.

Changqian · 22 sept. 2026 lire l'original ↗
↑