CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 21 votes

FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

QUESTION — Comment la compression de texte visuel à résolution adaptative peut-elle réduire les jetons tout en préservant les capacités de raisonnement ?

Cet article présente FocusVTC, qui résout le compromis compression-performance dans la compression de texte visuel (VTC) en utilisant une résolution adaptative. Il combine des vues globales compressées à faible DPI avec une amélioration de régions sélectives pendant le raisonnement. Les auteurs construisent 29.4K exemples de chaîne de pensée de localisation de preuves de raisonnement (REL-CoT) et emploient REL-SFT ainsi que l'optimisation de politique relative de groupe. FocusVTC obtient un score de 87,4 avec une compression d'entrée de 2,9fois sur RULER v1, dépasse son modèle de base textuel sur LongBench (56,40 contre 55,86), atteint une accélération de bout en bout de 2,79fois par rapport au texte, et préserve les capacités multimodales générales.

Obtient 87,4 à 2,9fois de compression d'entrée sur RULER v1 contre 57,5 pour Glyph à 3,0fois.

Surpasse son modèle de base textuel sur LongBench avec 56,40 contre 55,86.

Atteint une accélération de bout en bout en ligne de 2,79fois par rapport au texte et augmente le MMMU de 65,12 à 66,73.

zfz04 · 29 sept. 2026 lire l'original ↗
↑