CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 29 votes

A Zeroth-Order Paradigm for LLM Preference Alignment

QUESTION — Comment aligner les grands modèles de langage en utilisant une méthode d'ordre zéro basée sur des oracles de comparaison plutôt qu'en optimisant directement une perte de préférence différentiable ?

Les auteurs présentent Comparison-based Preference Optimization (ComPO), une méthode d'alignement d'ordre zéro qui exploite des oracles de comparaison pour extraire des informations directionnelles de paires de préférences sans optimiser directement une perte de préférence différentiable. L'approche comprend un schéma hors ligne avec des garanties de convergence et une variante en ligne qui utilise des générations de politiques non étiquetées pour le contrôle de la divergence KL inverse. Des expériences sur plusieurs familles de modèles démontrent des améliorations par rapport aux méthodes d'alignement direct existantes, y compris sur des métriques telles que les taux de victoire contrôlés par la longueur.

ComPO est une méthode d'alignement d'ordre zéro basée sur des oracles de comparaison pour extraire des informations directionnelles.

Online ComPO utilise des générations de politiques non étiquetées pour le contrôle de la divergence KL inverse par rapport à une politique de référence.

Des expériences sur les modèles Mistral, Llama, Gemma-2, Qwen3 et Gemma-3 démontrent des améliorations par rapport aux méthodes d'alignement direct existantes.

PeterLauLukCh · 16 sept. 2026 lire l'original ↗
↑