RECHERCHE
RRSI : amélioration récursive régularisée des harnesses d'agents
Contre le surapprentissage des agents LLM lors de l'auto-amélioration, RRSI introduit des régularisations pour favoriser des mécanismes réutilisables plutôt que des astuces spécifiques à un benchmark.
arXiv cs.AI · cs.LG · cs.CL·Peng Xia, Rujun Han, Zifeng Wang, Yanfei Chen·21 septembre 2026
Les capacités d'un agent LLM dépendent fortement de son harness (prompts, flux de contrôle, outils, mémoire). L'auto-amélioration récursive de ce harness tend à surapprendre les tâches d'entraînement, effaçant les gains sur des benchmarks hors distribution. RRSI incorpore des principes de régularisation : le proposant limite le nombre d'éditions et explore des trajectoires inédites, tandis que le sélecteur épingle les propositions spécifiques et émonde les changements obsolètes ou coûteux. Sur huit benchmarks, RRSI gagne jusqu'à 14,1 points en distribution et 4,7 points hors distribution.