CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 61 votes

ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

QUESTION — Comment évaluer les agents de codage sur des fonctionnalités de développement web découvertes grâce à l'interaction avec des applications de référence ?

Cet article présente ProgramDistill, un benchmark évaluant les agents de codage sur des fonctionnalités découvertes par interaction avec des applications de référence. Grâce à un pipeline automatisé, les auteurs découvrent 1 975 comportements vérifiés à travers 26 applications et construisent 4 063 tâches sans intervention humaine. Sur neuf agents de codage pionniers, GPT-6 Astra et Claude Opus 5 atteignent respectivement 49,2 % et 28,8 % de succès sur les flux de travail cumulatifs lors de la reconstruction d'applications.

Le pipeline mine-craft-patch découvre 1 975 comportements vérifiés sur 26 applications et construit 4 063 tâches automatiquement.

GPT-6 Astra et Claude Opus 5 atteignent 49,2 % et 28,8 % de succès sur les flux de travail cumulatifs lors de la reconstruction complète.

Dans la reconstruction partielle, le succès chute de 100 % à 64,0 % et de 96 % à 32 % lorsque la profondeur de restauration passe de 1 à 8.

beanie00 · 16 sept. 2026 lire l'original ↗
↑