Can Agents Design Libraries for Agents?
L'article présente LibraryDesignBench, un benchmark en deux phases comprenant 242 problèmes de programmation validés par des experts pour évaluer la conception de bibliothèques par des agents. Les résultats montrent que les agents concepteurs reproduisent les abstractions humaines dans 11 tâches sur 15. Cependant, les agents en aval sous-utilisent ces bibliothèques et écrivent du code superflu principalement en raison de leur rigidité. L'étude démontre que l'utilisation de consignes adaptées aux agents et de sous-agents de test améliore les scores en aval.
Le benchmark couvre 242 problèmes de programmation validés par des experts répartis sur 15 tâches de conception de bibliothèques dans quatre langues.
Sur onze des quinze tâches, les agents concepteurs reproduisent les abstractions de la bibliothèque de production écrite par des hommes.