CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 57 votes

EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos

QUESTION — Dans quelle mesure les modèles vidéo multimodaux actuels réussissent-ils le raisonnement centré sur les outils dans les vidéos égocentriques du monde réel?

Les tâches du monde réel exigent que les agents agissent sous des contraintes physiques où l'utilisation d'outils est centrale. Cependant, les modèles vidéo multimodaux actuels restent limités dans le raisonnement centré sur les outils en raison d'un manque de données égocentriques du monde réel et de benchmarks diagnostiques. Cette étude présente EgoTools, composé d'EgoTools-Data (un corpus d'enregistrements égocentriques de 100 heures) et d'EgoTools-Bench (un benchmark diagnostique de 1 000 paires QA). Les résultats expérimentaux montrent que les modèles actuels ont encore du mal à ancrer l'utilisation d'outils dans des preuves visuelles, mais un réglage minutieux supervisé avec EgoTools-Data améliore considérablement les performances du modèle.

Gemini-3.1-Pro atteint une précision globale de 66,9% mais seulement 51,7% sur la perception et l'ancrage.

Un réglage fin supervisé complet améliore Qwen3-VL-8B-Instruct de 50,0% à 60,9% sur l'ensemble du benchmark de 1 000 questions.

shulin16 · 30 sept. 2026 lire l'original ↗
↑