CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 15 upvote

World Embedding Benchmark

CÂU HỎI — Các biểu diễn video trong world model mã hóa thông tin vật lý như thế nào và điều này ảnh hưởng ra sao đến việc sinh video?

Bài báo giới thiệu World Embedding Benchmark gồm 8.000 trường hợp mô phỏng có kiểm soát từ 80 họ vật lý khác nhau nhằm đánh giá cách video representation mã hóa thông tin vật lý. Các tác giả phát hiện ra sự đánh đổi giữa căn chỉnh đa phương thức (cross-modal alignment) và khả năng khôi phục thông tin vật lý định lượng. Việc sử dụng các embedding này để truy xuất video tham khảo giúp cải thiện độ trung thực vật lý của video được sinh ra bằng mô hình như MiniMax-H3.

World Embedding Benchmark bao gồm 8.000 trường hợp mô phỏng có kiểm soát từ 80 họ vật lý.

Quá trình đào tạo đối lập liên tục giúp cải thiện việc truy xuất nhưng lại làm giảm khả năng hồi quy thuộc tính vật lý.

Việc truy xuất video tham khảo giúp cải thiện độ trung thực vật lý của các video được sinh ra.

gowitheflow · 02 thg 10, 2026 đọc bản gốc ↗
↑