CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 13 votes

Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite

QUESTION — Comment les trajectoires d'exécution diverses provenant de harnais d'agents spécialisés peuvent-elles être mises à l'échelle et reconstruites de manière systématique en données d'entraînement réutilisables ?

Les auteurs proposent Recursive Self-Rewrite (RSR), un framework qui exploite un modèle de base, Qwen-3.8-27B, pour découvrir des solutions réussies à travers divers harnais et les reconstruire sous forme de trajectoires d'entraînement. Un planificateur extrait les procédures en runbooks, un critique filtre les fuites et guide la révision, et un exécuteur les exécute dans de nouveaux bacs à sable. Le fine-tuning supervisé sur ces trajectoires surpasse significativement le modèle de base sur divers benchmarks de terminaux.

Trois harnais résolvent conjointement 759 tâches, soit 34,3 % de plus que le harnais individuel le plus fort du pool enregistré.

RSR développe 2 001 trajectoires sources réussies en 11 094 trajectoires réécrites pour le fine-tuning supervisé.

Par rapport au modèle de base, le pass@3 passe de 57,0 % à 74,2 % sur Terminal-Bench 2.

taesiri · 02 oct. 2026 lire l'original ↗
↑