CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — evaluation 45 votes

HappyWorld-Bench

QUESTION — Comment pouvons-nous évaluer de manière exhaustive la cohérence et la réactivité des modèles du monde lorsque les agents interagissent et explorent ?

L'article présente HappyWorld-Bench, un benchmark complet évaluant les modèles du monde à travers un cadre hiérarchique de six capacités (W1-W6) sur trois pistes indépendantes : vidéo, spatiale et incarnée. Il comprend 1 138 invites vidéo, 300 scènes spatiales et 254 cas de test incarnés. L'exploitation de HappyWorld-Arena pour des comparaisons A/B humaines génère des classements Elo qui complètent les métriques comportementales automatisées. L'évaluation de plusieurs modèles révèle des lacunes de fiabilité : les modèles vidéo affichent une cohérence réduite lors de déploiements prolongés, les modèles spatiaux atteignent au mieux 70,14 % de précision de placement et 73,33 % d'exécution de modification.

Spatial models achieve at best 70.14% placement accuracy and 73.33% edit execution.

HappyWorld-Bench comprises 1,138 video prompts, 300 spatial scenes, and 254 embodied test cases.

CheeryLJH · 21 sept. 2026 lire l'original ↗
↑