Toutes les news taguées avec ce sujet.
Un benchmark compare modèles et frameworks d'agents sur des tâches d'ingénierie logicielle multi-langages, avec des résultats mis à jour régulièrement.
13,6% des instances de SWE-bench Verified présentent un décalage entre pull request et issue, faussant l'évaluation des LLM sur la résolution de bugs.
Un RL à grande échelle est déployé sur 365 000 environnements pour des tâches SWE, terminal et recherche.
Une méthode exploite les représentations internes des agents de code pour optimiser l'élagage du contexte.