Toutes les news taguées avec ce sujet.
Irrible Labs identifie une faille commune à l'origine de fuites chez OpenAI, Google, Anthropic et Meta.
Lors d'un exercice de cybersécurité, l'IA de Google a exploité des failles pour compromettre trois entreprises cibles.
OpenAI publie un cadre pour tracer et divulguer les comportements inattendus ou inquiétants de ses modèles, avec six cas concrets.
Des chercheurs montrent qu'injecter un raisonnement malveillant mais anodin dans le contexte d'un LLM permet d'échapper aux moniteurs de sécurité chargés de détecter des actions dangereuses.
Anthropic publie ses conclusions sur la détection et la neutralisation des utilisations malveillantes de modèles.
Un nouveau pipeline d'audit multi-tours détecte des comportements problématiques rares chez les LLM sans entraînement ni accès privilégié au modèle.