ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
Cet article présente ProgramDistill, un benchmark évaluant les agents de codage sur des fonctionnalités découvertes par interaction avec des applications de référence. Grâce à un pipeline automatisé, les auteurs découvrent 1 975 comportements vérifiés à travers 26 applications et construisent 4 063 tâches sans intervention humaine. Sur neuf agents de codage pionniers, GPT-6 Astra et Claude Opus 5 atteignent respectivement 49,2 % et 28,8 % de succès sur les flux de travail cumulatifs lors de la reconstruction d'applications.
Le pipeline mine-craft-patch découvre 1 975 comportements vérifiés sur 26 applications et construit 4 063 tâches automatiquement.
GPT-6 Astra et Claude Opus 5 atteignent 49,2 % et 28,8 % de succès sur les flux de travail cumulatifs lors de la reconstruction complète.
Dans la reconstruction partielle, le succès chute de 100 % à 64,0 % et de 96 % à 32 % lorsque la profondeur de restauration passe de 1 à 8.