CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 6 upvote

Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models

CÂU HỎI — Làm thế nào để tách biệt hiệu ứng học tập tương quan trong tập dữ liệu khỏi các giá trị trừu tượng trong căn chỉnh sở thích đạo đức của LLM?

Công trình này nghiên cứu cách các mô hình ngôn ngữ lớn xử lý các xung đột giá trị đạo đức thông qua một tập dữ liệu gồm 12.000 trường hợp về các tình huống khó xử với ba xung đột giá trị cặp đôi. Để giải quyết hiện tượng thiên vị và tách biệt học tập tương quan khỏi các giá trị trừu tượng, các tác giả đề xuất một thí nghiệm dựa trên truyền vector tác vụ (task vector transfer). Bằng cách trực giao hóa vector tác vụ đối với vector tuân thủ hướng dẫn chung, phương pháp này cho phép cách ly hướng ưu tiên giá trị cụ thể nhằm thực hiện phép cộng trừ tác vụ để đạt được mô hình có quan điểm trái ngược.

GPT-5-mini liên tục ưu tiên Honesty hơn Autonomy trên cả năm ngôn ngữ khi không có chính sách nào được đưa ra.

Cả việc tinh chỉnh thông thường lẫn Direct Preference Optimization đều loại bỏ hiệu quả thiên vị tùy chọn đầu tiên, làm tăng độ chính xác lên lớn hơn 98% trên các mô hình Llama-3.2-1/3B.

Phương pháp truyền vector tác vụ dựa trên trực giao hóa hiệu quả trong việc cách ly hướng ưu tiên giá trị cụ thể để thực hiện phép cộng trừ tác vụ.

utkarshagarwal · 17 thg 9, 2026 đọc bản gốc ↗
↑