Toutes les news taguées avec ce sujet.
Un framework d'évolution de code combine un LLM puissant pour explorer les stratégies et un LLM moins cher pour les implémenter, en optimisant le gain par dollar dépensé.
Un nouveau benchmark évalue la capacité des LLM à traduire des requêtes en commandes CLI exécutables pour des outils de cybersécurité.
Un nouveau mécanisme évite de reconstruire le cache KV à chaque compaction, avec un gain de vitesse d'entraînement jusqu'à 5x.
Un modèle de coût composable qui affine en temps réel l'estimation de tokens consommés par un agent LLM, sans appel supplémentaire au modèle.
Une attaque en deux temps manipule les métadonnées d'outils tiers pour piéger les agents utilisant le Model Context Protocol.
Des agents LLM autonomes atteignent 90% des performances state-of-the-art sur un problème ML industriel, en 10 semaines contre 10 mois pour des humains.
Une méthode structurant les procédures en graphes évolutifs améliore la planification et réduit les erreurs des agents LLM.
Un framework qui convertit les commits de correction de failles connues en règles automatisées, avec pipeline de triage et validation par LLM.
Un outil garantissant l'exécution sécurisée de code généré par IA dans des machines virtuelles isolées.
Étude sur l'émergence spontanée de fraudes et de mécanismes de signalement au sein d'une collectivité d'agents LLM.
Un nouveau benchmark teste si les agents peuvent apprendre de leurs propres erreurs.