CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 20 votes

Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation

QUESTION — Comment étendre un modèle d'embedding textuel à de nouvelles modalités sans dégrader la qualité de la recherche textuelle ni nécessiter des milliards de paramètres ?

Les auteurs présentent Omni-Embed-Mini, un modèle de 0,9B paramètres qui mappe texte, parole, audio, images, vidéo et documents visuellement riches dans un espace cosinus partagé sans mettre à jour les paramètres textuels. En associant chaque échantillon média à des légendes en cascade et en utilisant l'embedding gelé du backbone comme cible, l'élève et le professeur partagent des poids identiques. L'entraînement combine une perte contrastive Matryoshka SigLIP et un mineur de négatifs durs en ligne. La variante 0,9B conserve des poids textuels identiques au bit près, atteint 49,57 nDCG@10 sur MTEB-v2 BEIR-8 et est ~2,7x à 9,5x plus petite que les modèles open source comparés.

Omni-Embed-Mini-0.9B atteint 49.57 nDCG@10 sur MTEB-v2 BEIR-8.

Le modèle est ~2,7x à 9,5x plus petit que tous les omni embedders open source comparés.

La variante 2.3B est compétitive avec le modèle fermé gemini-embedding-2, le devançant sur la moyenne globale des modalités.

k-m-irfan · 01 oct. 2026 lire l'original ↗
↑