FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation
L'article présente FLAT (Flexible-Length Aligned Transmodal representations), un cadre de pré-entraînement qui optimise conjointement un encodeur multimodal partagé avec des décodeurs texte-image (T2I) et image-texte (I2T). En combinant l'alignement contrastif avec des objectifs génératifs multimodaux bidirectionnels, FLAT mappe les entrées dans un espace de séquence 1D continu unifié, en appliquant un dropout imbriqué pour prendre en charge des longueurs de sortie dynamiques. FLAT atteint un score T2I GenEval de 71.1, atteignant 83.1 GenEval après un affinage spécifique à la tâche, ainsi que de solides résultats sur MS-COCO et Flickr30K.
FLAT atteint un score T2I GenEval de 71.1.
L'affinage spécifique à la tâche atteint 83.1 GenEval sur la génération T2I.
Il atteint 40.5 BLEU-4 et 138.6 CIDEr sur la légende d'images MS-COCO.