Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms
Nghiên cứu này điều tra nguyên nhân cốt lõi khiến các mô hình khuếch tán video (video diffusion models) tạo ra các chuyển động vi phạm vật lý thông qua phân tích cơ chế nội bộ của chúng. Tác giả thực hiện nghiên cứu khả năng giải thích đầu tiên về quá trình lập kế hoạch chuyển động, phát hiện ra rằng RoPE (Rotary Position Embedding) gây ra sự suy giảm chú ý không gian quá mức. Hiện tượng này làm cho các vùng ứng cử viên ban đầu bị khóa sớm ở các vị trí phi vật lý. Để khắc phục, họ đề xuất một sửa đổi kiến trúc nhẹ nhàng giúp điều chỉnh tần số của RoPE qua các bước khử nhiễu.
Xác định hiện tượng Rotary Position Embedding (RoPE) gây ra sự suy giảm chú ý không gian quá mức trong các mô hình khuếch tán video.
Đề xuất một sửa đổi kiến trúc nhẹ nhàng có tỷ lệ tần số RoPE qua các bước khử nhiễu để tăng cường tính logic vật lý.