CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 16 votes

FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation

QUESTION — Comment réaliser l'apprentissage conjoint de représentations multimodales et la génération sans limiter les performances par des embeddings figés ?

L'article présente FLAT (Flexible-Length Aligned Transmodal representations), un cadre de pré-entraînement qui optimise conjointement un encodeur multimodal partagé avec des décodeurs texte-image (T2I) et image-texte (I2T). En combinant l'alignement contrastif avec des objectifs génératifs multimodaux bidirectionnels, FLAT mappe les entrées dans un espace de séquence 1D continu unifié, en appliquant un dropout imbriqué pour prendre en charge des longueurs de sortie dynamiques. FLAT atteint un score T2I GenEval de 71.1, atteignant 83.1 GenEval après un affinage spécifique à la tâche, ainsi que de solides résultats sur MS-COCO et Flickr30K.

FLAT atteint un score T2I GenEval de 71.1.

L'affinage spécifique à la tâche atteint 83.1 GenEval sur la génération T2I.

Il atteint 40.5 BLEU-4 et 138.6 CIDEr sur la légende d'images MS-COCO.

imguangyu · 15 sept. 2026 lire l'original ↗
↑