AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs
QUESTION — Comment mesurer avec précision les capacités de collaboration à long terme de plusieurs agents LLM dans un environnement bac à sable complexe ?
L'étude présente AgentWorld, un benchmark de 100 tâches annotées par des humains avec 100 variantes pour évaluer la collaboration multi-agent à long terme sur plus de 50 rounds d'interaction dans un bac à sable MMORPG. Il nécessite de 3 à 20 agents aux rôles asymétriques pour se coordonner via la communication, la planification conjointe et le partage de ressources. Pour quantifier l'efficacité de la collaboration, les auteurs proposent l'Efficacité de la collaboration causale (CCE), une métrique basée sur un graphe traçant les dépendances causales. Les expériences montrent que le meilleur modèle n'atteint que 52,0 % de réussite.
Même le meilleur modèle n'atteint que 52,0 % de réussite aux tâches sur le benchmark AgentWorld.
taesiri · 25 sept. 2026
lire l'original ↗