Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation
Các tác giả giới thiệu Omni-Embed-Mini, một mô hình 0.9B tham số ánh xạ văn bản, giọng nói, âm thanh, hình ảnh, video và tài liệu phong phú trực quan vào một không gian cosine chung mà không cần cập nhật bất kỳ tham số phía văn bản nào. Bằng cách sử dụng các cặp mẫu phương tiện với chú thích tầng đậm đặc và mục tiêu giáo viên là embedding của chính backbone bị đóng băng, học sinh và giáo viên chia sẻ trọng số backbone giống hệt nhau. Quá trình huấn luyện kết hợp hàm mất mát đối lập Matryoshka SigLIP với bộ khai thác negative khó kết hợp trực tuyến. Phiên bản 0.9B duy trì trọng số văn bản giống hệt bit với backbone, đạt 49.57 nDCG@10 trên MTEB-v2 BEIR-8 và nhỏ hơn ~2.7x đến 9.5x so với mọi open omni embedder đối chứng.
Omni-Embed-Mini-0.9B đạt 49.57 nDCG@10 trên MTEB-v2 BEIR-8.
Mô hình nhỏ hơn ~2.7x đến 9.5x so với mọi open omni embedder được so sánh.
Phiên bản 2.3B cạnh tranh với gemini-embedding-2 dạng đóng và vượt qua nó về mức trung bình trên tất cả các modality.