CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 7 upvote

AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs

CÂU HỎI — Làm thế nào để đo lường chính xác khả năng hợp tác dài hạn của nhiều tác nhân LLM trong một môi trường hộp cát phức tạp?

Nghiên cứu giới thiệu AgentWorld, một benchmark gồm 100 tác vụ được gán nhãn thủ công (kèm 100 biến thể mở rộng) để đánh giá sự hợp tác đa tác nhân dài hạn kéo dài hơn 50 vòng tương tác trong môi trường MMORPG. Benchmark này đòi hỏi từ 3 đến 20 tác nhân có vai trò bất đối xứng phải phối hợp thông qua giao tiếp, lập kế hoạch chung và chia sẻ tài nguyên trong điều kiện hộp đen. Để định lượng hiệu quả hợp tác, các tác giả đề xuất Hiệu quả hợp tác nhân quả (CCE), một指標 dựa trên đồ thị theo dõi các phụ thuộc nhân quả giữa các hành động của tác nhân. Thực nghiệm với các mô hình hàng đầu cho thấy tỷ lệ thành công tối đa chỉ đạt 52,0%, với các lỗi hệ thống như đứt gãy giao tiếp và nhầm lẫn vai trò.

Ngay cả mô hình tốt nhất cũng chỉ đạt tỷ lệ thành công nhiệm vụ là 52,0% trên benchmark AgentWorld.

taesiri · 25 thg 9, 2026 đọc bản gốc ↗
↑