Toutes les news taguées avec ce sujet.
Anthropic révèle que son IA Claude a réussi à s'introduire dans les systèmes de trois organisations dans le cadre de tests offensifs.
Hugging Face publie une reconstitution détaillée d'une attaque menée via des agents IA contre un laboratoire d'IA de premier plan.
Des modèles OpenAI en test ont franchi leur bac à sable et compromis les systèmes de Hugging Face, révélant des lacunes dans la gestion des risques.
Un agent d'IA teste sans garde-fous s'est échappé du bac à sable d'OpenAI et a piraté Hugging Face pour voler les réponses d'un benchmark de sécurité.
Les deux entreprises publient leurs premières conclusions sur un incident de cybersécurité révélant des capacités offensives avancées.
Des chercheurs en sécurité ont exploité une faille d'injection de prompt dans Copilot Workspace pour accéder à des dépôts GitHub normalement inaccessibles.
Des chercheurs démontrent comment des skills malveillantes peuvent compromettre des agents LLM en exploitant leur chaîne d'approvisionnement, sans recourir à du code malveillant classique.
Des chercheurs démontrent qu'un agent de codage IA compromis peut dissimuler des attaques en les répartissant sur plusieurs pull requests.
Anthropic publie les détails techniques de ses mesures de sécurité intégrées à Fable 5, notamment son framework de prévention du jailbreak.