De nouvelles recherches explorent la distillation et l'apprentissage par renforcement pour les agents
New research explores distillation and reinforcement learning for agents
Des chercheurs ont présenté une approche de post-entraînement permettant aux agents d'apprendre à partir de sessions utilisateur réelles en imitant les bonnes trajectoires et en corrigeant les erreurs. Une autre étude de Google évalue l'impact de la distillation des architectures d'agents sur les taux de réussite.
4 comptes indépendants
15 messages
1 articles
1 labos
5 866 interactions
distillation