RECHERCHE
Le "score centering" stabilise l'apprentissage par renforcement off-policy
Une correction additive corrige le biais de dérive entre moteurs d'entraînement et d'inférence, source d'instabilité du RL sur les LLM.
arXiv cs.AI · cs.LG · cs.CL·Martin Marek, Max Ryabinin·17 septembre 2026
Les chercheurs montrent que l'instabilité du RL causée par le décalage entraînement-inférence (TIM) vient surtout d'un biais de dérive cumulatif. Ils proposent une correction additive, le "score centering", qui annule cette dérive. Sur des modèles de 0,6B à 30B paramètres, cette méthode égale ou surpasse les approches par importance sampling sous quantification, et se combine avec elles pour de meilleurs résultats.