Toutes les news taguées avec ce sujet.
Un nouveau benchmark évalue les agents LLM sur des workflows bureautiques longs avec des indicateurs économiques.
763 tâches ancrées dans la littérature évaluent les LLM sur quatre rôles de conception d'ingénierie physique, révélant des performances très inégales selon les étapes.
Un framework multi-agent automatise la détection et l'exploitation de failles IoT via LLM avec un taux de succès de 95%.
Un essai explore comment Claude peut assister la recherche scientifique via des méthodes d'optimisation contrainte.