Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
Bài báo đề xuất khung Mind2Dialogue nhằm giải quyết khoảng cách thiếu dữ liệu giám sát tường minh về niềm tin và mục tiêu chưa nói ra của người dùng trong các cuộc hội thoại trợ lý LLM. Hệ thống sử dụng một trình giả lập hướng dẫn bởi tâm lý học để cập nhật trạng thái tâm lý tiến hóa trong quá trình tương tác, từ đó tạo ra các cuộc trò chuyện mạch lạc và phản hồi chuẩn từ trợ lý Oracle. Quá trình chưng cất đặc quyền sau đó huấn luyện các mô hình dựa trên các phản hồi này. Kết quả đánh giá trên các cơ sở dữ liệu cho thấy việc huấn luyện trên toàn bộ kho ngữ liệu Mind2Dialogue cải thiện mọi chỉ số cá nhân hóa được báo cáo so với các baseline Qwen, Llama và OLMo.
Mind2Dialogue cải thiện mọi metric cá nhân hóa được báo cáo so với các baseline Qwen, Llama và OLMo instruction-tuned.
Phương pháp mang lại mức tăng từ 26.6 đến 40.9 percentage points trong việc tạo sinh tuân theo sở thích (preference-following generation).