Toutes les news taguées avec ce sujet.
Un benchmark compare modèles et frameworks d'agents sur des tâches d'ingénierie logicielle multi-langages, avec des résultats mis à jour régulièrement.
13,6% des instances de SWE-bench Verified présentent un décalage entre pull request et issue, faussant l'évaluation des LLM sur la résolution de bugs.
Mercor et Ramp lancent un benchmark fermé de 160 tâches comptables. Aucun modèle ne dépasse 56% de réussite moyenne.
Un nouveau protocole d'évaluation isole les LLM de toute donnée post-événement pour mesurer une vraie capacité de prévision, pas du simple rappel.
Une étude formalise une faille des évaluateurs de plans : supprimer des étapes gênantes peut améliorer artificiellement leur score, et propose un mécanisme de blocage.