LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
Nghiên cứu này trình bày LynnReal-Omni, một framework tạo video đa phương thức gốc xây dựng trên transformer khuếch tán chia sẻ 32B, hợp nhất văn bản thành video, tạo có điều kiện hình ảnh, điều khiển cấu trúc và chỉnh sửa dài hạn. Hệ thống chấp nhận nhiều đầu vào hình ảnh khác nhau như tham chiếu ngoại hình, render 3D và bản ghi game. Tác giả cũng huấn luyện một biến thể 27B Flash để kết xuất thời gian thực, cùng bộ đánh giá MSAVP gồm 100 prompt và 20 metric. Trên một GPU H100, thời gian tạo và giải mã khung hình 540p 22 khung hình mất 843 ms với LynnReal-Omni và 377 ms với bản Flash.
LynnReal-Omni sử dụng kiến trúc transformer khuếch tán đa phương thức chia sẻ 32B và phiên bản Flash 27B cho kết xuất thời gian thực.
Xây dựng đánh giá MSAVP gồm 100-prompt và 20-metric để tách bạch khả năng tuân thủ hướng dẫn và chất lượng trực quan.
Trên một H100, quá trình sinh và giải mã video 540p 22 khung hình mất 843 ms với LynnReal-Omni và 377 ms với bản Flash.