RelateAnything: Real-Time Open-Vocabulary Relation Prediction From Any Inputs
Các tác giả giới thiệu RelateAnything, một mô hình 53 triệu tham số nhận hình ảnh và vùng từ bất kỳ nguồn nào để trả về các quan hệ có điểm số trên từ vựng vị từ cung cấp dưới dạng chuỗi tại thời điểm suy luận. Mô hình sử dụng một ngân hàng embedding văn bản thay vì bộ phân loại đã học và chạy ở tốc độ 20 ms/khung hình. Để huấn luyện mô hình, họ xây dựng tập dữ liệu RA-4M gồm 474k hình ảnh và 4.3M quan hệ, đồng thời thiết lập benchmark OV-SGG-Bench để đo lường hiệu suất.
RelateAnything là một mô hình 53M-parameter chạy ở tốc độ 20 ms/frame.
RA-4M chứa 474k hình ảnh và 4.3M quan hệ trên 10,102 vị từ văn bản tự do.
Trên ba benchmark xuyên tập dữ liệu và một zero-shot thứ tư, RelateAnything đạt 2.3-3.5x độ thu hồi trung bình so với phương pháp open-vocabulary mạnh nhất có quy mô tương đương.