CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 73 votes

Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings

QUESTION — Comment pouvons-nous construire une famille de plongements omnimodaux universels prenant en charge le texte, l'image, la vidéo et l'audio dans un espace de représentation partagé ?

Les auteurs présentent Ovis-Embedding, une famille de plongements omnimodaux de pointe construite sur un tronc commun multimodal intégrant le texte, l'image, la vidéo et l'audio dans un espace de représentation partagé. L'approche utilise un modèle Qwen-omni pré-entraîné adapté par un entraînement contrastif avec initialisation de rang faible, un corpus de données diversifié avec échantillonnage de sources homogènes, ainsi que des optimisations d'entraînement et d'inférence comprenant la perte focale et la distillation de plongements basée sur la similarité. Les évaluations empiriques montrent des performances de pointe sur MMEB-v3, MMEB-v2, MVEB, MAEB et RTEB.

Ovis-Embedding achieves state-of-the-art performance on MMEB-v3, MMEB-v2, MVEB, MAEB, and RTEB.

taesiri · 21 sept. 2026 lire l'original ↗
↑