CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 5 votes

RelateAnything: Real-Time Open-Vocabulary Relation Prediction From Any Inputs

QUESTION — Comment prédire des relations à vocabulaire ouvert en temps réel à partir d'entrées arbitraires sans être contraint par des étiquettes d'objets fixes ?

Les auteurs présentent RelateAnything, un modèle de 53 millions de paramètres qui prend une image et des régions de n'importe quelle source pour renvoyer des relations notées sur un vocabulaire de prédicats fourni sous forme de chaînes lors de l'inférence. Le modèle utilise une banque d'embeddings textuels au lieu d'un classificateur appris et fonctionne à 20 ms/image. Pour permettre l'entraînement, les auteurs ont construit RA-4M avec 474k images et 4.3M relations, et ont établi OV-SGG-Bench pour évaluer les performances.

RelateAnything est un modèle de 53 millions de paramètres s'exécutant à 20 ms/image.

RA-4M comprend 474k images et 4.3M relations sur 10 102 prédicats en texte libre.

Sur trois benchmarks inter-ensembles de données et un quatrième en zéro-shot, RelateAnything obtient un rappel moyen de 2,3 à 3,5 fois supérieur à celui de la méthode à vocabulaire ouvert la plus puissante d'échelle comparable.

nielsr · 11 sept. 2026 lire l'original ↗
↑