Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing
Nghiên cứu giới thiệu Align Then Reason (ATR), một hệ thống đánh giá lip-sync đa ngôn ngữ hoạt động dựa trên video không tiếng và văn bản. ATR thiết lập một sự căn chỉnh đơn điệu (monotonic alignment) giữa biểu diễn khẩu hình ở cấp độ khung hình và các đơn vị âm vị của câu ứng viên, sau đó dùng LLM để suy luận dựa trên cấu trúc căn chỉnh này nhằm đưa ra phán quyết về nội dung và thời gian. Kết quả trên benchmark 7 ngôn ngữ cho thấy ATR cải thiện đáng kể diện tích dưới đường cong ROC (AUC) so với các baseline SFT thông thường trên các mô hình 2B, 4B và 9B.
Trên benchmark bảy ngôn ngữ, phương pháp này cải thiện mean AUC so với Qwen3.5 SFT baselines tương ứng là 59.4%, 50.2%, và 50.8% với các reasoner 2B, 4B, và 9B.
Các cải tiến này đạt mức cải thiện mean AUC là 45.9% và 46.6% so với baseline tốt nhất cho LLaMA-3.1-8B và Mistral-7B.
Ở tác vụ dub-line reranking, ATR-9B vượt trội hơn baseline lip-reading tốt nhất 52.0%, còn trong script-to-clip assignment cải thiện 17.7%.