EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making
Cet article soutient que le post-entraînement typique ne parvient pas à susciter les connaissances intériorisées du monde dans les LLM, ce qui conduit à une mauvaise généralisation dans des environnements invisibles. Pour surmonter cela sans entraîner de modèles de monde explicites, les auteurs présentent EVOKE, une méthode de post-entraînement qui introduit la diversité des objectifs à états fixes. En classant les actions candidates sous des objectifs alternatifs tout en maintenant l'état de l'environnement constant, EVOKE empêche les politiques de s'appuyer sur des habitudes contextuelles superficielles. Cela force le modèle à eliciter implicitement ses connaissances préalables pour une prise de décision correcte. Des évaluations sur diverses tâches et modèles de base démontrent des performances améliorées, une meilleure généralisation et une efficacité des données accrue.
EVOKE démontre des performances de tâche améliorées et une généralisation à des environnements invisibles.
La méthode atteint une efficacité des données accrue grâce à la supervision directe des décisions sous diversité d'objectifs.