CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 25 upvote

Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation

CÂU HỎI — Làm thế nào để đánh giá khả năng mô phỏng hành động thao tác có mục tiêu trong việc tạo video góc nhìn thứ nhất?

Nghiên cứu này giải quyết vấn đề thiếu hụt các tiêu chuẩn đánh giá khả năng suy luận vật lý nhiều bước trong việc tạo video góc nhìn thứ nhất (egocentric video generation). Tác giả giới thiệu Ego2Act, một benchmark chứa 2.640 video từ 110 tác vụ thực tế với độ phức tạp đa dạng, cùng với Ego2ActJudge, một hệ thống đánh giá không cần tham chiếu giúp đồng thuận tốt hơn với con người về độ hoàn thành tác vụ và tính hợp lý vật lý. Kết quả thực nghiệm cho thấy các mô hình hiện tại thường bỏ qua hoặc thực hiện không đầy đủ các bước, đồng thời thất bại trong việc mô phỏng động lực vật lý tinh vi khi thao tác đồ vật phức tạp.

Ego2Act features 2,640 videos from 110 real-world tasks across day-to-day settings, varying object clutter and multi-step complexity.

Ego2ActJudge achieves better task completion and physics plausibility evaluation alignment with human consensus compared to relevant baselines.

patrickamadeus · 01 thg 10, 2026 đọc bản gốc ↗
↑