Agent-Editing World Model: Rethinking World Modeling for LLM Agents
Les auteurs proposent l'Agent-Editing World Model (AEWM), un cadre qui modélise la manière dont le raisonnement et les actions façonnent la progression des tâches plutôt que de simuler des réponses d'outils à haute entropie. Le système associe un Action Judge pour catégoriser les décisions en Critical, Exploratory et Noisy avec un State Revision pour éditer les continuations de raisonnement-action bruitées. De plus, EditAct intègre ces capacités à l'exécution réelle pour modifier directement l'état sous-jacent des décisions ultérieures. Entraîné sur Search, Terminal et Software Engineering, AEWM atteint 70,5% de macro-F1 sur le benchmark Action Judge et améliore les scores moyens sur plusieurs benchmarks.
AEWM atteint 70,5% de macro-F1 sur notre benchmark Action Judge, dépassant la baseline de frontière la plus forte de 10,6 points.
À travers six benchmarks et trois backbones d'agents, EditAct améliore les scores moyens de 3,2--6,7 points par rapport à la baseline la plus forte.
AEWM-RFT surpasse Self-RFT de 2,2--2.6 points sur trois domaines sans guidage AEWM en ligne.