CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 15 votes

World Embedding Benchmark

QUESTION — Comment les représentations vidéo encodent-elles l'information physique et comment peuvent-elles être exploitées pour améliorer la fidélité de la génération de vidéos ?

Les auteurs introduisent le World Embedding Benchmark, comprenant 8 000 cas de simulation contrôlés à travers 80 familles, pour évaluer la manière dont les représentations vidéo encodent l'information physique. Ils révèlent un compromis entre l'alignement physique intermodal et la récupérabilité des informations quantitatives. L'utilisation de ces embeddings pour récupérer des vidéos de référence améliore la fidélité physique des vidéos générées.

Le benchmark comprend 8 000 cas de simulation contrôlés issus de 80 familles couvrant la mécanique des fluides, la mécanique des solides, la dynamique et l'optique.

L'entraînement contrastif continu améliore la recherche et la classification par paires mais dégrade la régression des propriétés physiques.

Les références récupérées améliorent la fidélité physique des vidéos générées avec MiniMax-H3.

gowitheflow · 02 oct. 2026 lire l'original ↗
↑