Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
Les auteurs présentent Ovis-Embedding, une famille de plongements omnimodaux de pointe construite sur un tronc commun multimodal intégrant le texte, l'image, la vidéo et l'audio dans un espace de représentation partagé. L'approche utilise un modèle Qwen-omni pré-entraîné adapté par un entraînement contrastif avec initialisation de rang faible, un corpus de données diversifié avec échantillonnage de sources homogènes, ainsi que des optimisations d'entraînement et d'inférence comprenant la perte focale et la distillation de plongements basée sur la similarité. Les évaluations empiriques montrent des performances de pointe sur MMEB-v3, MMEB-v2, MVEB, MAEB et RTEB.
Ovis-Embedding achieves state-of-the-art performance on MMEB-v3, MMEB-v2, MVEB, MAEB, and RTEB.