CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 73 upvote

Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings

CÂU HỎI — Làm thế nào để xây dựng một họ embedding đa phương thức toàn diện hỗ trợ văn bản, hình ảnh, video và âm thanh trong cùng một không gian biểu diễn chung?

Nghiên cứu giới thiệu Ovis-Embedding, một họ embedding đa phương thức tích hợp sẵn văn bản, hình ảnh, video và âm thanh bằng cách dùng chung một multimodal backbone thay vì các tháp mô-đun riêng biệt. Giải pháp tận dụng mô hình Qwen-omni khởi tạo trước thông qua quá trình huấn luyện tương phản với khởi tạo low-rank, xây dựng tập dữ liệu chất lượng cao với việc lấy mẫu nguồn đồng nhất, đồng thời tối ưu hóa quá trình huấn luyện và suy luận bằng focal loss cùng Embedding Distillation dựa trên độ tương đồng. Khi suy luận, kỹ thuật phân rã đặc trưng low-rank cho phép tạo ra các embedding nhỏ gọn với kích thước linh hoạt mà ít suy giảm hiệu năng. Mô hình đạt hiệu suất state-of-the-art trên các benchmark MMEB-v3, MMEB-v2, MVEB, MAEB và RTEB.

Ovis-Embedding achieves state-of-the-art performance on MMEB-v3, MMEB-v2, MVEB, MAEB, and RTEB.

taesiri · 21 thg 9, 2026 đọc bản gốc ↗
↑