CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — inference 49 upvote

Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

CÂU HỎI — Làm thế nào để kết hợp cơ chế attention tuyến tính và Softmax trong mô hình khuếch tán video nhằm tăng tốc sinh video dài mà không giảm chất lượng?

Tác giả trình bày Video DeltaNet (VDN), một kiến trúc attention kết hợp lai nhằm giảm nút thắt cổ chai tính toán trong các mô hình khuếch tán video. Nhánh tuyến tính của VDN tích hợp Video Delta Attention để cập nhật bộ nhớ mỗi khung hình qua các token không gian, trong khi vẫn duy trì attention Softmax cho các tương tác văn bản hoặc âm thanh. Bằng cách áp dụng phương pháp căn chỉnh giáo viên theo từng giai đoạn kết hợp với quá trình chưng cất 8 bước và stack phục vụ SGLang được tối ưu, VDN-H3 có thể xử lý denoising cho video 768p trong thời gian ngắn trên nền tảng phần cứng nhiều GPU.

VDN-H3 hoàn thành việc khử nhiễu DiT cho video 768p dài 14.3 giây trong 6.70 giây trên 8 GPU NVIDIA B200.

Phương pháp đạt tốc độ nhanh hơn 14.5x so với baseline H3 dùng dense 50 bước trên cùng số lượng GPU.

Kiến trúc áp dụng chưng cất 8 bước kết hợp với stack phục vụ SGLang đã được tối ưu.

taesiri · 17 thg 9, 2026 đọc bản gốc ↗
↑