Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
Nghiên cứu giới thiệu Ovis-Embedding, một họ embedding đa phương thức tích hợp sẵn văn bản, hình ảnh, video và âm thanh bằng cách dùng chung một multimodal backbone thay vì các tháp mô-đun riêng biệt. Giải pháp tận dụng mô hình Qwen-omni khởi tạo trước thông qua quá trình huấn luyện tương phản với khởi tạo low-rank, xây dựng tập dữ liệu chất lượng cao với việc lấy mẫu nguồn đồng nhất, đồng thời tối ưu hóa quá trình huấn luyện và suy luận bằng focal loss cùng Embedding Distillation dựa trên độ tương đồng. Khi suy luận, kỹ thuật phân rã đặc trưng low-rank cho phép tạo ra các embedding nhỏ gọn với kích thước linh hoạt mà ít suy giảm hiệu năng. Mô hình đạt hiệu suất state-of-the-art trên các benchmark MMEB-v3, MMEB-v2, MVEB, MAEB và RTEB.
Ovis-Embedding achieves state-of-the-art performance on MMEB-v3, MMEB-v2, MVEB, MAEB, and RTEB.