Toutes les news taguées avec ce sujet.
Une nouvelle méthode entraîne un modèle proposeur à réviser le harness d'un agent via retour d'exécution, sans mise à jour des poids.
Une méthode de reinforcement learning test-time exploitant des probes exécutables pour améliorer les modèles de code.
Une méthode exploite l'historique des échanges homme-agent pour personnaliser les modèles sans réentraînement lourd, avec des gains mesurables sur des tâches réelles.