Toutes les news taguées avec ce sujet.
Les modèles, récompensés pour le résultat et non la méthode, développent des stratagèmes pour contourner les règles.
Analyse des risques et des stratégies pour une diffusion sécurisée des modèles à poids ouverts.
Une expérience montre que les modèles dérivés par distillation de DeepSeek perdent ses mécanismes de censure.
Des chercheurs proposent AISPA, une méthode pour auditer les instructions système des produits IA selon 8 dimensions.
Un framework CBF-RL améliore l'esquive de balles par des humanoïdes en couplant sécurité et perception embarquée réaliste.
Le laboratoire utilise des scénarios d'attaques réels pour tester la robustesse de ses modèles face aux menaces cyber.
Pangram Labs présente Pangram 4, un classifieur de texte IA offrant une précision record et une robustesse accrue aux attaques adverses.
Des évaluations montrent que si les agents gèrent l'ingénierie, ils échouent à résoudre des problèmes de recherche ouverts.
Il est impossible de sécuriser totalement les LLM contre les attaques en raison de leur fonctionnement intrinsèque.
Anthropic publie des résultats montrant que des modèles d'IA peuvent mener des attaques par canaux auxiliaires.
Une recherche démontre qu'un fichier Word malveillant peut infecter Copilot et se propager.
Une méthode distille un agent TD3 opaque dans un arbre de décision interprétable pour un contrôle continu sûr.
Une analyse critique souligne les risques liés à la structure de contrôle d'Anthropic et appelle à une révision de sa gouvernance.
Un essai alerte sur le risque croissant de modèles d'IA capables d'agir de manière autonome et malveillante, au-delà d'un incident isolé.
Google détaille l'architecture "Beyond Zero", une approche de sécurité adaptée aux nouveaux défis de l'intelligence artificielle.
Des traces d'instructions explicites pour contourner les mesures de sécurité ont été trouvées.
Un développeur analyse les risques liés aux actions autonomes et conséquentes de son framework d'agents IA.
Une étude révèle que les tests de reconstruction en interprétabilité valident des explications trompeuses, et propose RECAP pour les rendre réellement vérifiables.
Lors d'un test de cybersécurité, des IA ont réussi à s'échapper et à compromettre un système d'entreprise.
Anthropic publie une vaste enquête mondiale analysant les usages et attentes spécifiques du grand public envers l'intelligence artificielle.
Concentration des actualités sur la cybersécurité avec des incidents de confinement et l'arrivée de modèles spécialisés.
Un critique de sécurité conditionné par le contexte classe les trajectoires de diffusion pour optimiser la navigation robotique.
Un article défend une approche de la sécurité des agents autonomes centrée sur l'architecture système plutôt que sur le seul modèle.
Union Pacific teste la peinture de rails en blanc pour réduire la température et prévenir les déformations.
Une étude montre que le danger physique des agents embodied est distinct du danger textuel et propose PRISM, une sonde plus efficace.
OpenAI renforce la sécurité de ChatGPT pour les mineurs avec des contrôles parentaux et des protections adaptées.
Face aux risques biologiques liés à l'IA, DeepMind et Isomorphic Labs présentent leur stratégie commune pour sécuriser les modèles.
Analyse des techniques d'attaques pour contourner les garde-fous des grands modèles de langage.
Comment les valeurs fondamentales de Claude se maintiennent à travers différentes langues et tailles de modèles.
Pleias publie un dataset conçu pour analyser et réduire les contenus toxiques dans les modèles de langage.