CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 29 upvote

A Zeroth-Order Paradigm for LLM Preference Alignment

CÂU HỎI — Làm thế nào để align các LLM bằng cách sử dụng zeroth-order optimization dựa trên comparison oracles thay vì tối ưu hóa một differentiable preference loss trực tiếp?

Các tác giả giới thiệu Comparison-based Preference Optimization (ComPO), một phương pháp alignment zeroth-order tận dụng comparison oracles để trích xuất thông tin định hướng từ các cặp preference mà không cần tối ưu hóa loss khả vi trực tiếp. Phương pháp này có cả phiên bản offline kèm bảo đảm hội tụ lẫn phiên bản online sử dụng unlabeled policy generations cho reverse-KL control. Các thí nghiệm trên nhiều họ mô hình chứng minh cải tiến so với các phương pháp direct alignment hiện tại, bao gồm cả các chỉ số như length-controlled win rates.

ComPO là một phương pháp alignment zeroth-order dựa trên comparison oracles để trích xuất thông tin định hướng.

Online ComPO sử dụng unlabeled policy generations cho reverse-KL control dựa trên reference policy.

Các thí nghiệm trên Mistral, Llama, Gemma-2, Qwen3 và Gemma-3 chứng minh sự cải tiến so với các phương pháp direct alignment hiện có.

PeterLauLukCh · 16 thg 9, 2026 đọc bản gốc ↗
↑