Toutes les news taguées avec ce sujet.
Une étude empirique montre que le taux de compilation, indicateur phare pour évaluer la réparation de code par IA, récompense en réalité les non-corrections.
Analyse empirique de la capacité des agents IA à appliquer correctement les méthodes de vérification et de tests logiciels.
Un nouveau cadre d'évaluation exploite les traces d'exécution pour améliorer le benchmarking d'agents logiciels.