REALM: A Coarse-to-Fine Generative Framework for Embodied Reactive Listening
Việc tạo chuyển động khuôn mặt cho người nghe phản hồi trong AI hội thoại đòi hỏi phải xử lý thời điểm của các tín hiệu từ người nói đồng thời duy trì tính liên tục của chuyển động và các sự kiện khuôn mặt biến đổi cục bộ. Để giải quyết các thách thức này, nghiên cứu đề xuất REALM (Reactive Embodied Audio-driven Listening Model), một framework từ thô đến tinh kết hợp căn chỉnh thời gian nhận biết lịch sử với việc tinh chỉnh biểu cảm ngẫu nhiên. Mô-đun dung hợp kết hợp lịch sử chuyển động của người nghe với âm thanh của người nói thông qua bộ chú ý trễ và điều phối thích ứng. Bộ giải mã thô dự đoán quỹ đạo cơ sở, được bổ sung bằng phần dư ngẫu nhiên có điều kiện âm thanh. Đánh giá trên các bộ dữ liệu ViCo và L2L cho thấy những cải tiến so với các mô hình cơ sở.
REALM cải thiện các mô hình cơ sở đã đánh giá trên nhiều chỉ số chất lượng chuyển động dựa trên ViCo và L2L.
Việc triển khai thực tế trên robot hình người Ameca chứng minh khả năng áp dụng của hành vi được tạo ra cho hiện thân vật lý.