Toutes les news taguées avec ce sujet.
Contre le surapprentissage des agents LLM lors de l'auto-amélioration, RRSI introduit des régularisations pour favoriser des mécanismes réutilisables plutôt que des astuces spécifiques à un benchmark.
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.