RECHERCHE
ERPO : optimisation de politique pour le code à l'exécution
Une méthode de reinforcement learning test-time exploitant des probes exécutables pour améliorer les modèles de code.
arXiv cs.AI · cs.LG · cs.CL·Jiacheng Xu, Feng Chen, Xiuneng Xu, Bo An·8 septembre 2026
Cette étude introduit ERPO, une approche de test-time reinforcement learning pour la génération de code. Elle utilise des sondes sans sortie et un consensus comportemental pour générer des récompenses, atténuant les dérives de politique et le reward hacking. Les résultats montrent des gains significatifs en pass@1 et pass@k sur les benchmarks de code.