A Zeroth-Order Paradigm for LLM Preference Alignment
Các tác giả giới thiệu Comparison-based Preference Optimization (ComPO), một phương pháp alignment zeroth-order tận dụng comparison oracles để trích xuất thông tin định hướng từ các cặp preference mà không cần tối ưu hóa loss khả vi trực tiếp. Phương pháp này có cả phiên bản offline kèm bảo đảm hội tụ lẫn phiên bản online sử dụng unlabeled policy generations cho reverse-KL control. Các thí nghiệm trên nhiều họ mô hình chứng minh cải tiến so với các phương pháp direct alignment hiện tại, bao gồm cả các chỉ số như length-controlled win rates.
ComPO là một phương pháp alignment zeroth-order dựa trên comparison oracles để trích xuất thông tin định hướng.
Online ComPO sử dụng unlabeled policy generations cho reverse-KL control dựa trên reference policy.
Các thí nghiệm trên Mistral, Llama, Gemma-2, Qwen3 và Gemma-3 chứng minh sự cải tiến so với các phương pháp direct alignment hiện có.