RECHERCHE
Un paradigme d'ordre zéro pour l'alignement des préférences des LLM
ComPO propose une méthode d'optimisation basée sur des oracles de comparaison pour contourner les limites des approches d'alignement direct classiques.
arXiv cs.AI · cs.LG · cs.CL·Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin·16 septembre 2026
Les chercheurs présentent Comparison-based Preference Optimization (ComPO), une méthode zeroth-order qui extrait de l'information directionnelle à partir de paires de préférences sans optimiser directement une perte différentiable. Une garantie de convergence est établie pour le schéma offline, ainsi qu'une variante online utilisant le contrôle par reverse-KL. Les tests sur Mistral, Llama, Gemma-2, Qwen3 et Gemma-3 montrent des améliorations par rapport aux méthodes d'alignement direct existantes.