CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 8 votes

All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation

QUESTION — Comment résoudre l'asymétrie de correspondance intermodale entre la vidéo et les modalités associées dans les transformateurs de diffusion multimodaux conjoints?

L'étude révèle une asymétrie dans les transformateurs de diffusion multimodaux conjoints: les modalités compagnes comme le mouvement corporel 3D ou l'audio forment de fortes correspondances avec la vidéo, mais les correspondances inverses sont plus faibles, un écart qualifié d'écart de correspondance réciproque. Les auteurs introduisent RecCAR (Reciprocal Cross-modal Attention Regularization), un régularisateur KL qui utilise la correspondance vidéo-modalité établie comme référence fixe pour aligner la correspondance inverse. Des expériences montrent que RecCAR améliore les scores anatomiques et réduit la désynchronisation audio-vidéo.

Améliore le score d'anatomie humaine de 0.69 à 0.75.

Réduit la désynchronisation audio-vidéo de 0.804 à 0.752.

ohad204 · 23 sept. 2026 lire l'original ↗
↑