RelateAnything: Real-Time Open-Vocabulary Relation Prediction From Any Inputs
Les auteurs présentent RelateAnything, un modèle de 53 millions de paramètres qui prend une image et des régions de n'importe quelle source pour renvoyer des relations notées sur un vocabulaire de prédicats fourni sous forme de chaînes lors de l'inférence. Le modèle utilise une banque d'embeddings textuels au lieu d'un classificateur appris et fonctionne à 20 ms/image. Pour permettre l'entraînement, les auteurs ont construit RA-4M avec 474k images et 4.3M relations, et ont établi OV-SGG-Bench pour évaluer les performances.
RelateAnything est un modèle de 53 millions de paramètres s'exécutant à 20 ms/image.
RA-4M comprend 474k images et 4.3M relations sur 10 102 prédicats en texte libre.
Sur trois benchmarks inter-ensembles de données et un quatrième en zéro-shot, RelateAnything obtient un rappel moyen de 2,3 à 3,5 fois supérieur à celui de la méthode à vocabulaire ouvert la plus puissante d'échelle comparable.