Toutes les news taguées avec ce sujet.
Une méthode de fine-tuning basée uniquement sur des explications rétrospectives rivalise avec GRPO sur SWE-bench, sans reward ni verifier.
Une analyse comparative isolant les composants clés (planification, espace d'action, contexte) influençant la performance des agents autonomes.
Une méthode sépare la génération de tests de la réparation pour améliorer les performances des agents.
Un framework léger prédit l'issue d'une tâche d'agent avant sa fin, coupant jusqu'à 44% des tokens consommés sans perte de précision.