Coding Agents for Generalized Task and Motion Planning Problems
Cet article étudie si les agents de codage peuvent automatiser la planification généralisée des tâches et des mouvements (TAMP) en synthétisant des programmes dans un budget fixe. En évaluant Claude Code (Opus 5) et Codex (GPT-5.6 Sol et GPT-6 Astra) sur 28 environnements simulés de KinDER et PDDLStream sur un total de 98 000 épisodes d'évaluation, les auteurs démontrent que les agents surclassent les planificateurs conçus à la main. Les agents atteignent un taux de réussite moyen de 56 % à 95 % contre 47 % pour les planificateurs, tout en consommant un ordre de grandeur de calcul en moins par instance.
À travers toutes les méthodes de synthèse de programmes, nous évaluons 980 programmes générés sur 100 instances de test chacun, soit 98 000 épisodes d'évaluation au total.
Les trois configurations d'agents surclassent les planificateurs conçus à la main, la génération one-shot et une référence de planification généralisée basée sur un LLM en termes de succès moyen (56 % à 95 % contre 47 % pour les planificateurs, sur les 16 environnements où un planificateur est disponible).
À mesure que le nombre d'objets augmente, les programmes des agents maintiennent un succès supérieur à celui du planificateur, en utilisant en moyenne un ordre de grandeur de calcul en moins par instance.