CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 5 upvote

RelateAnything: Real-Time Open-Vocabulary Relation Prediction From Any Inputs

CÂU HỎI — Làm thế nào để dự đoán quan hệ mở thời gian thực từ bất kỳ đầu vào hình ảnh và vùng nào mà không bị ràng buộc bởi các nhãn đối tượng cố định?

Các tác giả giới thiệu RelateAnything, một mô hình 53 triệu tham số nhận hình ảnh và vùng từ bất kỳ nguồn nào để trả về các quan hệ có điểm số trên từ vựng vị từ cung cấp dưới dạng chuỗi tại thời điểm suy luận. Mô hình sử dụng một ngân hàng embedding văn bản thay vì bộ phân loại đã học và chạy ở tốc độ 20 ms/khung hình. Để huấn luyện mô hình, họ xây dựng tập dữ liệu RA-4M gồm 474k hình ảnh và 4.3M quan hệ, đồng thời thiết lập benchmark OV-SGG-Bench để đo lường hiệu suất.

RelateAnything là một mô hình 53M-parameter chạy ở tốc độ 20 ms/frame.

RA-4M chứa 474k hình ảnh và 4.3M quan hệ trên 10,102 vị từ văn bản tự do.

Trên ba benchmark xuyên tập dữ liệu và một zero-shot thứ tư, RelateAnything đạt 2.3-3.5x độ thu hồi trung bình so với phương pháp open-vocabulary mạnh nhất có quy mô tương đương.

nielsr · 11 thg 9, 2026 đọc bản gốc ↗
↑