RECHERCHE
VLoc Bench : évaluer la localisation de vulnérabilités par des agents à l'échelle d'un dépôt
Un nouveau benchmark de 500 vulnérabilités réelles révèle les limites des agents LLM pour localiser précisément le code vulnérable dans un dépôt.
arXiv cs.AI · cs.LG · cs.CL·Aman Priyanshu, Supriti Vijay, Kimia Majd, Xuhong He·14 septembre 2026
VLoc Bench évalue 27 modèles de langage et quatre outils d'analyse statique sur leur capacité à localiser des vulnérabilités connues dans des dépôts logiciels réels, avant et après correction. Le meilleur système n'atteint que 0,229 en File F1, et 38,4% des tâches ne sont résolues correctement par aucun modèle. Les auteurs montrent aussi qu'une bonne localisation avant patch n'implique pas un comportement fiable après remédiation.