ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
QUESTION — Comment les agents d'IA scientifique peuvent-ils co-évoluer continuellement leurs harnais et leurs poids de modèle grâce à une boucle d'auto-amélioration récursive ?
Les auteurs présentent ScienceBuddy, un espace de travail de recherche scientifique interactif qui met en œuvre l'auto-amélioration récursive dans la récursive pour adapter continuellement les agents d'IA. Ce paradigme associe l'évolution du harnais d'exécution à l'apprentissage par renforcement du modèle : une récursion interne optimise le harnais avec des poids de modèle fixes, tandis qu'une récursion externe entraîne le modèle sur le harnais amélioré. Des études de cas couvrant quatre familles de tâches scientifiques démontrent l'efficacité de cette approche.
ScienceBuddy associe l'évolution du harnais à l'apprentissage par renforcement du modèle via un paradigme d'auto-amélioration récursive dans la récursive.
Lingaaaaaaa · 15 sept. 2026
lire l'original ↗