RECHERCHE
Cliff : apprentissage des récompenses par processus dès la première erreur
Une nouvelle méthode RLVR identifie la première erreur de raisonnement pour guider l'entraînement des LLM.
arXiv cs.AI · cs.LG · cs.CL·Peixuan Han, Runhui Wang, Ketan Ramaneti, Jie Hao·2 septembre 2026
Cliff est une stratégie de reward shaping pour le RLVR qui utilise un LLM pour détecter la première erreur dans un raisonnement. Elle décompose le processus en préfixe correct et suffixe incorrect, convertissant ce signal en avantages au niveau des tokens. Les expériences montrent une amélioration des performances de 15% par rapport à la distillation on-policy.