Toutes les news taguées avec ce sujet.
Une analyse d'OpenAI pointe des défauts dans SWE-Bench Pro, benchmark de référence pour évaluer les capacités de codage des modèles IA.