RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
L'article présente Regularized Recursive Self-Improvement of Agent Harnesses (RRSI), qui intègre des principes de régularisation dans l'évolution des harnais d'agents pour éviter le surapprentissage. Le proposant utilise un budget temporellement atténué et encourage les trajectoires inexplorées. Le sélecteur intègre un critique pour filtrer les propositions et un élagueur pour supprimer les modifications inefficaces. Sur huit benchmarks couvrant la programmation et l'ingénierie, RRSI gagne jusqu'à 14,1 points sur le jeu d'évolution, s'améliore de 4,7 points sur des benchmarks hors distribution et fonctionne avec 30% de tokens de politique en moins.
RRSI gagne jusqu'à 14,1 points sur le jeu de données d'évolution et jusqu'à 4,7 points sur cinq benchmarks hors distribution.
Le harnais résultant fonctionne avec 30% de tokens de politique en moins par rapport à une évolution non régularisée.