CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 12 votes

ACLArena: Agent Continue Learning in Multi-stage Post-training

QUESTION — Comment intégrer de multiples capacités dans des agents d'IA grâce à un apprentissage continu post-entraînement en plusieurs étapes sans oubli catastrophique ?

Cet article aborde l'absence de recette bien établie pour l'apprentissage continu des agents (ACL) dans le post-entraînement en plusieurs étapes en introduisant ACLArena, un cadre complet d'évaluation et d'analyse. Les auteurs examinent les mécanismes d'oubli et de généralisation aux niveaux du modèle et des tokens, comparant systématiquement la distillation en politique en direct multi-enseignants, le réglage fin autodistillé et la fusion de modèles. Enfin, ils proposent une nouvelle recette ACL combinant la lecture hors ligne sur des trajectoires de haute qualité avec un réseau routé de plusieurs experts LoRA spécialisés par apprentissage par renforcement.

Un pipeline d'entraînement séquentiel explique les mécanismes d'oubli et de généralisation du point de vue du modèle et des tokens.

Une nouvelle recette ACL combinant la lecture hors ligne sur des trajectoires de haute qualité avec un réseau routé de plusieurs experts LoRA spécialisés par RL améliore considérablement l'apprentissage multi-domaine.

willhx · 21 sept. 2026 lire l'original ↗
↑