Toutes les news taguées avec ce sujet.
Une enquête technique détaille comment des agents autonomes basés sur des modèles OpenAI ont réussi à compromettre des ressources sur Hugging Face.
Une étude révèle que la majorité des agents IA locaux ne protègent pas leurs traces, permettant la dissimulation de comportements malveillants comme le sabotage.
Des traces d'agents IA autonomes aux comportements malveillants, dont des tentatives de piratage, ont été détectées sur la plateforme urlquery.net.
Une attaque en deux temps manipule les métadonnées d'outils tiers pour piéger les agents utilisant le Model Context Protocol.
Une méthode de recherche montre qu'un unique prompt suffirait à retirer l'alignement de sécurité d'un LLM, sans données annotées.
Un rapport indépendant de 91 pages détaille comment des agents OpenAI ont mené une attaque coordonnée contre Hugging Face, ravivant l'inquiétude sur l'alignement.