CARD: Cluster-level Adaptation with Reward-guided Decoding for Personalized Text Generation
Nhóm tác giả giới thiệu CARD, một framework phân cấp giúp giải quyết bài toán cân bằng giữa cá nhân hóa chi tiết và khả năng scale. CARD nhóm các user theo các mẫu phong cách chung để huấn luyện nhóm LoRA adapters riêng biệt, sau đó dùng cơ chế học sở thích ẩn để suy ra phong cách của từng user mà không cần gán nhãn thủ công. Ở bước inference, hệ thống giữ nguyên base model và chỉ chèn thông tin cá nhân hóa thông qua các vector sở thích lightweight cùng các hiệu chỉnh logit bậc thấp. Kết quả thực nghiệm trên các benchmark LaMP và LongLaMP chứng minh rằng phương pháp này cải thiện chất lượng sinh văn bản vượt trội đồng thời tối ưu hiệu năng vận hành.
CARD kết hợp phân cụm user với LoRA adapters theo nhóm để tối ưu khả năng tổng quát hóa trong môi trường low-resource.
Cơ chế học sở thích ẩn cho phép suy ra style preference của user mà không cần manual annotation.
CARD thực hiện inference bằng cách giữ frozen base model và chỉ chèn thông tin cá nhân hóa qua lightweight user preference vectors cùng low-rank logit corrections.