CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 208 votes

ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement

QUESTION — Comment rendre l'auto-amélioration récursive des harnais d'agents généralisable sans surajustement aux benchmarks d'évaluation ni confusion des détails de tâches ?

L'article présente ModularRSI, un cadre modulaire, contrastif et indépendant des benchmarks, conçu pour faire évoluer les harnais d'agents. Il décompose le harnais en cinq modules fonctionnels, comme l'Agent Loop et le Tool Use, et s'appuie sur 2 000 tâches d'évolution externes. En contrastant les trajectoires réussies et échouées, ModularRSI isole les carences comportementales sans surajustement. Des expériences sur TB2.0 et SWE-Bench Verified montrent des améliorations constantes sur des tâches inédites et une forte transférabilité entre différents modèles de fondation.

ModularRSI sélectionne 2 000 tâches d'évolution exécutables provenant de sources externes, dissociées des benchmarks d'évaluation en aval.

Le système décompose le harnais évolutif en cinq modules fonctionnels qui évoluent indépendamment dans des limites restreintes.

Des expériences sur TB2.0 et SWE-Bench Verified montrent des améliorations constantes sur des tâches inédites en domaine et hors domaine.

SiweiWu · 14 sept. 2026 lire l'original ↗
↑