All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation
L'étude révèle une asymétrie dans les transformateurs de diffusion multimodaux conjoints: les modalités compagnes comme le mouvement corporel 3D ou l'audio forment de fortes correspondances avec la vidéo, mais les correspondances inverses sont plus faibles, un écart qualifié d'écart de correspondance réciproque. Les auteurs introduisent RecCAR (Reciprocal Cross-modal Attention Regularization), un régularisateur KL qui utilise la correspondance vidéo-modalité établie comme référence fixe pour aligner la correspondance inverse. Des expériences montrent que RecCAR améliore les scores anatomiques et réduit la désynchronisation audio-vidéo.
Améliore le score d'anatomie humaine de 0.69 à 0.75.
Réduit la désynchronisation audio-vidéo de 0.804 à 0.752.