RECHERCHE
Quand et où faire confiance à l'enseignant : unifier distillation on-policy et GRPO via attribution de crédit calibrée par l'entropie
Une nouvelle méthode combine signaux du vérificateur et du modèle enseignant dans GRPO pour affiner l'apprentissage du raisonnement mathématique token par token.
arXiv cs.AI · cs.LG · cs.CL·Jie Zhang, Jingxiao Yang, Zhehao Huang, Yuhang Liu·23 septembre 2026
UECR-GRPO fusionne récompense vérifiable et guidance d'un modèle enseignant dans une même mise à jour GRPO, aux niveaux réponse et token. La méthode redistribue le crédit selon l'écart enseignant-politique pondéré par l'entropie, tout en préservant le crédit total par réponse. Testée sur cinq benchmarks de raisonnement mathématique.