CompoWorld: Compositional Environment Scaling for General Agents
Les auteurs présentent CompoWorld, un cadre qui étend l'espace des tâches en composant une bibliothèque finie de services réutilisables. Des agents de codage transforment les spécifications d'outils en services vérifiés avec des états typés et des interfaces partagées, tandis qu'un modèle du monde gère les outils non fiables. Des trajectoires vérifiées soutiennent le supervised fine-tuning (SFT), tandis qu'une récompense basée sur des rubriques guide le reinforcement learning (RL). En entraînant Qwen3.6-35B-A3B avec 448 services exposant 10 130 outils, la méthode améliore les performances de 9,17 points en moyenne sur huit benchmarks et surpasse les modèles de pointe sur AutomationBench.
CompoWorld construit 448 services exposant 10 130 outils et utilise 3K SFT trajectories et 1K RL tasks pour entraîner Qwen3.6-35B-A3B.
CompoWorld s'améliore par rapport à son modèle de base de 9,17 points en moyenne sur huit benchmarks.
Sur AutomationBench, il surpasse des modèles de pointe tels que Claude Opus 4.6 et devance tous les modèles 35B-A3B spécialisés dans les agents.