CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 55 upvote

LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows

CÂU HỎI — Làm thế nào để kết hợp các tác vụ tạo video đa phương thức gốc với điều khiển tác vụ agentic một cách ổn định và thời gian thực?

Nghiên cứu này trình bày LynnReal-Omni, một framework tạo video đa phương thức gốc xây dựng trên transformer khuếch tán chia sẻ 32B, hợp nhất văn bản thành video, tạo có điều kiện hình ảnh, điều khiển cấu trúc và chỉnh sửa dài hạn. Hệ thống chấp nhận nhiều đầu vào hình ảnh khác nhau như tham chiếu ngoại hình, render 3D và bản ghi game. Tác giả cũng huấn luyện một biến thể 27B Flash để kết xuất thời gian thực, cùng bộ đánh giá MSAVP gồm 100 prompt và 20 metric. Trên một GPU H100, thời gian tạo và giải mã khung hình 540p 22 khung hình mất 843 ms với LynnReal-Omni và 377 ms với bản Flash.

LynnReal-Omni sử dụng kiến trúc transformer khuếch tán đa phương thức chia sẻ 32B và phiên bản Flash 27B cho kết xuất thời gian thực.

Xây dựng đánh giá MSAVP gồm 100-prompt và 20-metric để tách bạch khả năng tuân thủ hướng dẫn và chất lượng trực quan.

Trên một H100, quá trình sinh và giải mã video 540p 22 khung hình mất 843 ms với LynnReal-Omni và 377 ms với bản Flash.

shaohao011 · 14 thg 9, 2026 đọc bản gốc ↗
↑