CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 201 votes

RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

QUESTION — Comment l'auto-amélioration récursive des harnais d'agents LLM peut-elle être régularisée pour éviter le surapprentissage sur les tâches d'entraînement ?

L'article présente Regularized Recursive Self-Improvement of Agent Harnesses (RRSI), qui intègre des principes de régularisation dans l'évolution des harnais d'agents pour éviter le surapprentissage. Le proposant utilise un budget temporellement atténué et encourage les trajectoires inexplorées. Le sélecteur intègre un critique pour filtrer les propositions et un élagueur pour supprimer les modifications inefficaces. Sur huit benchmarks couvrant la programmation et l'ingénierie, RRSI gagne jusqu'à 14,1 points sur le jeu d'évolution, s'améliore de 4,7 points sur des benchmarks hors distribution et fonctionne avec 30% de tokens de politique en moins.

RRSI gagne jusqu'à 14,1 points sur le jeu de données d'évolution et jusqu'à 4,7 points sur cinq benchmarks hors distribution.

Le harnais résultant fonctionne avec 30% de tokens de politique en moins par rapport à une évolution non régularisée.

richardxp888 · 21 sept. 2026 lire l'original ↗
↑