CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 66 upvote

VideoGen-Agent: Reinforcing Video Generation Agents

CÂU HỎI — Làm thế nào để huấn luyện agent sinh video sử dụng công cụ bên ngoài thông qua reinforcement learning đa nhiệm?

Nghiên cứu giới thiệu VideoGen-Agent, một multimodal agent được huấn luyện thông qua reinforcement learning đa nhiệm để phối hợp các công cụ augmentation, generation và verification qua các tương tác đa vòng. Mô hình khởi đầu bằng supervised fine-tuning trên các quỹ đạo do giáo viên tạo ra, sau đó được tinh chỉnh bằng reinforcement learning sử dụng phần thưởng hỗn hợp nhận thức danh mục. Tác giả cũng xây dựng VABench, một benchmark gồm 600 prompt nhằm đánh giá toàn diện các khía cạnh như bảo toàn danh tính thực thể, tính nhất quán vật lý và cấu trúc thời gian.

Trên VABench, VideoGen-Agent cải thiện điểm số so với mô hình sinh text-to-video cơ sở 19.1 điểm, tăng từ 56.5 lên 75.6.

Việc nâng cấp các công cụ sinh giúp nâng điểm số lên 86.1 mà không cần huấn luyện thêm agent.

Người đánh giá con người ưu ái cấu hình được nâng cấp hơn baseline độc lập mạnh nhất trong 84.3% số trường hợp so sánh.

taesiri · 21 thg 9, 2026 đọc bản gốc ↗
↑