Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models
Công trình này nghiên cứu cách các mô hình ngôn ngữ lớn xử lý các xung đột giá trị đạo đức thông qua một tập dữ liệu gồm 12.000 trường hợp về các tình huống khó xử với ba xung đột giá trị cặp đôi. Để giải quyết hiện tượng thiên vị và tách biệt học tập tương quan khỏi các giá trị trừu tượng, các tác giả đề xuất một thí nghiệm dựa trên truyền vector tác vụ (task vector transfer). Bằng cách trực giao hóa vector tác vụ đối với vector tuân thủ hướng dẫn chung, phương pháp này cho phép cách ly hướng ưu tiên giá trị cụ thể nhằm thực hiện phép cộng trừ tác vụ để đạt được mô hình có quan điểm trái ngược.
GPT-5-mini liên tục ưu tiên Honesty hơn Autonomy trên cả năm ngôn ngữ khi không có chính sách nào được đưa ra.
Cả việc tinh chỉnh thông thường lẫn Direct Preference Optimization đều loại bỏ hiệu quả thiên vị tùy chọn đầu tiên, làm tăng độ chính xác lên lớn hơn 98% trên các mô hình Llama-3.2-1/3B.
Phương pháp truyền vector tác vụ dựa trên trực giao hóa hiệu quả trong việc cách ly hướng ưu tiên giá trị cụ thể để thực hiện phép cộng trừ tác vụ.