CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 16 upvote

FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation

CÂU HỎI — Làm thế nào để học chung các biểu diễn đa phương thức và khả năng sinh mã mà không bị giới hạn bởi các embedding bị đóng băng?

Bài báo giới thiệu FLAT (Flexible-Length Aligned Transmodal representations), một framework tiền huấn luyện biểu diễn kết hợp tối ưu hóa encoder đa phương thức chung cùng với decoder văn bản sang ảnh (T2I) và ảnh sang văn bản (I2T). Bằng cách kết hợp căn chỉnh tương phản với các mục tiêu sinh xuyên tâm hai chiều, FLAT ánh xạ các đầu vào thành một không gian chuỗi 1D liên tục thống nhất, sử dụng dropout lồng nhau để hỗ trợ độ dài đầu ra động. Trong quá trình đánh giá, FLAT đạt điểm T2I GenEval là 71.1 ở trạng thái cơ sở, và cải thiện lên 83.1 GenEval khi tinh chỉnh theo nhiệm vụ cụ thể, cùng với các kết quả vượt trội trên MS-COCO và Flickr30K.

FLAT đạt điểm T2I GenEval là 71.1 từ một giai đoạn tiền huấn luyện duy nhất.

Fine-tuning theo nhiệm vụ đạt 83.1 GenEval trên T2I generation.

Mô hình đạt 40.5 BLEU-4 và 138.6 CIDEr trên MS-COCO image captioning.

imguangyu · 15 thg 9, 2026 đọc bản gốc ↗
↑