When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents
Ce travail étudie la dérive d'intention, un mode de défaillance multi-tours où des parties périmées de l'intention de l'utilisateur continuent d'influencer la réponse finale ou les actions d'outils des agents LLM. Les auteurs présentent IntentFlux, un banc d'essai exécutable convertissant des tâches vérifiables en dialogues avec des changements d'intention contrôlés, démontrant que les scores moyens des tâches chutent à mesure que les dialogues accumulent des informations retirées. Ils introduisent également StateForge, un mécanisme qui maintient explicitement les exigences actives avant la génération, améliorant le score moyen des tâches sur General-Test de 0,367 à 0,467 et établissant la maintenance explicite de l'état comme une atténuation partielle.
In a 627-case calibration, mean task score falls from 0.476 to 0.384 as dialogues contain more superseded and withdrawn information.
On General-Test, StateForge improves mean task score from 0.367 to 0.467.