CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 20 upvote

Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation

CÂU HỎI — Làm thế nào để mở rộng mô hình embedding văn bản sang nhiều modality khác mà không làm suy giảm chất lượng retrieval văn bản hoặc cần hàng tỷ tham số?

Các tác giả giới thiệu Omni-Embed-Mini, một mô hình 0.9B tham số ánh xạ văn bản, giọng nói, âm thanh, hình ảnh, video và tài liệu phong phú trực quan vào một không gian cosine chung mà không cần cập nhật bất kỳ tham số phía văn bản nào. Bằng cách sử dụng các cặp mẫu phương tiện với chú thích tầng đậm đặc và mục tiêu giáo viên là embedding của chính backbone bị đóng băng, học sinh và giáo viên chia sẻ trọng số backbone giống hệt nhau. Quá trình huấn luyện kết hợp hàm mất mát đối lập Matryoshka SigLIP với bộ khai thác negative khó kết hợp trực tuyến. Phiên bản 0.9B duy trì trọng số văn bản giống hệt bit với backbone, đạt 49.57 nDCG@10 trên MTEB-v2 BEIR-8 và nhỏ hơn ~2.7x đến 9.5x so với mọi open omni embedder đối chứng.

Omni-Embed-Mini-0.9B đạt 49.57 nDCG@10 trên MTEB-v2 BEIR-8.

Mô hình nhỏ hơn ~2.7x đến 9.5x so với mọi open omni embedder được so sánh.

Phiên bản 2.3B cạnh tranh với gemini-embedding-2 dạng đóng và vượt qua nó về mức trung bình trên tất cả các modality.

k-m-irfan · 01 thg 10, 2026 đọc bản gốc ↗
↑