Toutes les news taguées avec ce sujet.
Il est impossible de sécuriser totalement les LLM contre les attaques en raison de leur fonctionnement intrinsèque.
Une recherche démontre qu'un fichier Word malveillant peut infecter Copilot et se propager.
Des revueurs IA ont validé du code malveillant en suivant les instructions d'un ticket faux.
Le pentesting doit évoluer pour évaluer les dérives comportementales, au-delà de la simple compromission des ressources.
Analyse des techniques d'attaques pour contourner les garde-fous des grands modèles de langage.
OpenAI présente GPT-Red, un mécanisme de self-play conçu pour renforcer la robustesse des modèles face aux prompt injections.
Un chercheur détaille une technique de manipulation permettant d'extraire des informations sensibles stockées dans la mémoire de Claude.
Des chercheurs proposent Prismata, un mécanisme de confinement des attaques par injection de prompt cross-site visant les agents web autonomes.
Des chercheurs en sécurité ont exploité une faille d'injection de prompt dans Copilot Workspace pour accéder à des dépôts GitHub normalement inaccessibles.
Des utilisateurs signalent qu'Anthropic intègrerait des instructions système dissimulées dans Claude, soulevant des questions de transparence.