FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation
Bài báo giới thiệu FLAT (Flexible-Length Aligned Transmodal representations), một framework tiền huấn luyện biểu diễn kết hợp tối ưu hóa encoder đa phương thức chung cùng với decoder văn bản sang ảnh (T2I) và ảnh sang văn bản (I2T). Bằng cách kết hợp căn chỉnh tương phản với các mục tiêu sinh xuyên tâm hai chiều, FLAT ánh xạ các đầu vào thành một không gian chuỗi 1D liên tục thống nhất, sử dụng dropout lồng nhau để hỗ trợ độ dài đầu ra động. Trong quá trình đánh giá, FLAT đạt điểm T2I GenEval là 71.1 ở trạng thái cơ sở, và cải thiện lên 83.1 GenEval khi tinh chỉnh theo nhiệm vụ cụ thể, cùng với các kết quả vượt trội trên MS-COCO và Flickr30K.
FLAT đạt điểm T2I GenEval là 71.1 từ một giai đoạn tiền huấn luyện duy nhất.
Fine-tuning theo nhiệm vụ đạt 83.1 GenEval trên T2I generation.
Mô hình đạt 40.5 BLEU-4 và 138.6 CIDEr trên MS-COCO image captioning.