WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
Bài báo giới thiệu WanPE, một model prompt enhancement có 397B tham số được train trên 1,05 triệu video thực tế để thực hiện quy hoạch điện ảnh cấp độ shot. WanPE sử dụng phương pháp reverse construction kết hợp với thuật toán Semantic-Consistency GRPO (SC-GRPO) nhằm bảo toàn yêu cầu của người dùng qua nhiều shot và thời gian. Khi tích hợp vào Wan3.0, WanPE giúp tăng điểm ưa thích của con người đáng kể so với prompt gốc, đặc biệt vượt trội trong các video có độ dài từ 30 giây trong các bài test đánh giá mù.
WanPE là một prompt enhancement model có quy mô 397B-parameter huấn luyện trên 1,05M video.
WanPE sử dụng Semantic-Consistency GRPO (SC-GRPO) để bảo toàn tính nhất quán ngữ nghĩa.
WanPE cải thiện điểm ưu tiên của người dùng lên 10,66-18,84 điểm ở phân khúc 5-15 giây và 50,86 điểm ở phân khúc 30 giây.