CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 11 upvote

VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation

CÂU HỎI — Làm thế nào để đánh giá và cải thiện khả năng hiển thị văn bản trực quan trong các mô hình tạo video?

Công trình này giải quyết khoảng trống trong việc đánh giá văn bản trực quan của các mô hình tạo video hiện tại bằng cách giới thiệu VTR-Bench, một benchmark có hệ thống bao gồm 300 prompt chia thành 5 nhóm kịch bản ứng dụng. Các tác giả phát triển một pipeline đánh giá tự động kết hợp sự căn chỉnh của con người để kiểm tra độ trung thực của văn bản và yêu cầu chuyển động của cảnh. Họ cũng đề xuất Keyframe-Guided Agentic Framework, trong đó một agent Director phối hợp tạo ảnh và video cùng đánh giá trực quan để hướng dẫn quá trình tinh chỉnh lặp. Thực nghiệm trên 11 mô hình state-of-the-art cho thấy hiệu suất kém, trong đó mô hình tốt nhất đạt word error rate (WER) là 0,250.

VTR-Bench features 300 carefully constructed prompts spanning five scenario categories.

The best-performing model records an overall word error rate (WER) of 0.250 across 11 evaluated state-of-the-art models.

Jungang · 01 thg 10, 2026 đọc bản gốc ↗
↑