REALM: A Coarse-to-Fine Generative Framework for Embodied Reactive Listening
La génération de mouvements faciaux réactifs pour les agents conversationnels incarnés nécessite de concilier la synchronisation des indices de l'orateur tout en maintenant la continuité du mouvement. Pour relever ces défis, les auteurs proposent REALM (Reactive Embodied Audio-driven Listening Model), un cadre allant du grossier au fin combinant un alignement temporel conscient de l'historique et un raffinement stochastique des expressions. Un module de fusion intègre l'historique des mouvements de l'auditeur et l'audio de l'orateur grâce à une attention centrée sur le délai. Un décodeur grossier prédit les trajectoires de base, augmentées par des résidus stochastiques conditionnés par l'audio. Les évaluations sur ViCo et L2L montrent des améliorations par rapport aux bases de référence.
Les évaluations sur ViCo et L2L montrent des améliorations par rapport aux références évaluées sur plusieurs métriques de qualité de mouvement.
Le déploiement sur un robot humanoïde Ameca et une étude utilisateur perceptuelle démontrent l'applicabilité du comportement généré à une incarnation physique.