Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
L'article propose le framework Mind2Dialogue pour combler le fossé de supervision concernant les croyances et objectifs non-dits des utilisateurs dans l'entraînement d'assistants LLM. Le système utilise un simulateur guidé par la psychologie pour mettre à jour les états mentaux évolutifs par l'interaction, générant des conversations cohérentes et des réponses informées d'un assistant Oracle. La distillation privilégiée entraîne ensuite les modèles sur ces réponses. Les évaluations démontrent que l'entraînement sur l'ensemble du corpus Mind2Dialogue améliore chaque métrique de personnalisation rapportée par rapport aux modèles de base Qwen, Llama et OLMo.
Mind2Dialogue améliore chaque métrique de personnalisation rapportée par rapport aux baselines instruction-tuned Qwen, Llama et OLMo.
Les gains incluent des augmentations de 26.6 à 40.9 percentage points dans la génération guidée par les préférences (preference-following generation).