CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 45 upvote

HappyWorld-Bench

CÂU HỎI — Làm thế nào để đánh giá toàn diện tính nhất quán và khả năng phản hồi của các world model khi agent tương tác và khám phá?

Bài báo giới thiệu HappyWorld-Bench, một benchmark toàn diện đánh giá các world model thông qua khung khả năng phân cấp gồm 6 khả năng (W1-W6) trên 3 track độc lập: video, không gian và môi trường embodied. Benchmark này bao gồm 1.138 video prompt, 300 cảnh không gian và 254 test case embodied. Các tác giả vận hành HappyWorld-Arena để thu thập so sánh A/B của con người, tạo xếp hạng Elo kết hợp với các metric tự động đo lường độ chính xác hành vi. Kết quả đánh giá trên nhiều mô hình cho thấy các mô hình video giảm độ nhất quán trong các rollout kéo dài, mô hình không gian đạt tối đa 70.14% độ chính xác vị trí và 73.33% thực thi chỉnh sửa, trong khi mô hình embodied gặp khó khăn trong việc duy trì trạng thái qua nhiều bước.

Spatial models achieve at best 70.14% placement accuracy and 73.33% edit execution.

HappyWorld-Bench comprises 1,138 video prompts, 300 spatial scenes, and 254 embodied test cases.

CheeryLJH · 21 thg 9, 2026 đọc bản gốc ↗
↑