CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 8 upvote

All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation

CÂU HỎI — Làm thế nào để khắc phục sự bất đối xứng trong tương ứng chéo đa phương thức giữa video và các phương thức bổ trợ trong mô hình khuếch tán?

Nghiên cứu chỉ ra rằng các mô hình khuếch tán đa phương thức chung gặp hiện tượng bất đối xứng: các phương thức bổ trợ (như chuyển động 3D hoặc âm thanh) tạo ra tương ứng mạnh với video, nhưng chiều ngược lại rất yếu. Sự chênh lệch này được định nghĩa là reciprocal correspondence gap. Nhóm tác giả giới thiệu RecCAR (Reciprocal Cross-modal Attention Regularization), một bộ điều chuẩn KL sử dụng tương ứng video-sang-phương thức làm tham chiếu cố định để căn chỉnh chiều ngược lại. Thử nghiệm trên sinh video-chuyển động và video-âm thanh cho thấy RecCAR cải thiện độ chính xác giải phẫu và giảm độ lệch pha âm thanh-video.

Cải thiện điểm số Human Anatomy từ 0.69 lên 0.75.

Giảm độ mất đồng bộ giữa âm thanh và video từ 0.804 xuống 0.752.

ohad204 · 23 thg 9, 2026 đọc bản gốc ↗
↑