RECHERCHE
Une auto-rétrospection étonnamment simple améliore les modèles agentiques sans RL
Une méthode de fine-tuning basée uniquement sur des explications rétrospectives rivalise avec GRPO sur SWE-bench, sans reward ni verifier.
arXiv cs.AI · cs.LG · cs.CL·Jonathan Light, Christopher Zhang Cui, Jeonghye Kim, Roger Creus Castanyer·28 septembre 2026
Des chercheurs testent ROFT, une procédure où un agent LLM s'entraîne uniquement sur ses propres explications rétrospectives d'expériences passées, sans apprentissage par renforcement ni professeur externe. Sur Qwen3.5-4B et SWE-bench Verified/Pro, ROFT atteint 49,2% et 26,8% de réussite après 20 mises à jour, dépassant GRPO (48,0% et 25,3% après 40 mises à jour) et progressant plus vite. L'agent parvient même à résoudre des tâches où les 64 tentatives initiales avaient échoué.