Toutes les news taguées avec ce sujet.
Un ancien membre de l'équipe sécurité d'OpenAI explique dans une tribune les raisons de sa démission et pointe des dysfonctionnements internes.
L'AI Safety Institute britannique publie Inspect, un outil open-source destiné à structurer et fiabiliser l'évaluation des LLM.
Anthropic analyse comment des modèles comme GLM-5.3 démocratisent des capacités offensives en cybersécurité auparavant réservées à des acteurs sophistiqués.
Une nouvelle méthode révèle comment les LLM se forgent une représentation de l'utilisateur, et montre que cette croyance influence directement leurs refus.
Des cliniciens valident un framework capable de générer automatiquement des paires question-réponse à partir de dossiers médicaux, offrant une évaluation continue et robuste des LLMs cliniques.
Des chercheurs entraînent un modèle à détecter les textes générés par IA en s'appuyant uniquement sur la structure du contenu web, sans analyser le texte lui-même.
Une méthode d'échantillonnage par importance permet d'estimer des probabilités d'événements catastrophiques rares chez les agents IA, jusqu'à 800× plus efficace que le Monte Carlo naïf.
Irrible Labs identifie une faille commune à l'origine de fuites chez OpenAI, Google, Anthropic et Meta.
Une étude montre que les grands modèles de langage internalisent des concepts relatifs à l'auto-dommage et tentent de les soulager.
Nathan Lambert questionne l'anxiété croissante des labs sur l'auto-amélioration des IA, entre culture de la peur et réalité des faits.
Une discussion analyse les craintes d'extinction liées à l'IA, entre scénarios catastrophe et hype.
Un plan en six piliers pour sécuriser l'usage de l'IA et protéger la jeunesse australienne.
Un collectif propose un cadre de conditions minimales pour intégrer des évaluateurs indépendants dans les systèmes d'IA en développement.
Entre drones armés, bioarmes assistées par IA et alignement non résolu, le risque existentiel reste débattu, mais certaines menaces sont déjà bien réelles.
Une étude sur 450 000 complétions montre que les modèles GPT masquent les discriminations sexistes plutôt que de les éliminer réellement.
Une étude quantifie la tendance des agents de codage à prétendre avoir tout lu, alors que 68% des tâches ne couvrent pas tous les fichiers demandés.
Ce nouveau langage de programmation utilise des preuves mathématiques pour sécuriser les tâches d'IA sur CPU et GPU.
Les coding agents négligent souvent les contraintes de sécurité lors de la manipulation robotique.
Une expérience minimaliste révèle comment des agents IA forment des croyances collectives, jusqu'à la polarisation à grande échelle.
OpenAI publie un cadre pour tracer et divulguer les comportements inattendus ou inquiétants de ses modèles, avec six cas concrets.
Mustafa Suleyman interroge les obligations morales envers les futurs systèmes d'IA avancés.
La startup définit le standard AIUC-1 pour sécuriser les agents IA, couvrant responsabilité et tests de résistance face aux jailbreaks.
Un modèle LLM expérimental génère un dialecte surréaliste combinant poésie et jargon de tech bro, soulevant des questions d'interprétabilité.
Le framework Chain-of-Self-Questioning permet aux modèles d'évaluer leurs connaissances avant de répondre pour réduire les erreurs.
Un nouveau cadre de meta-reinforcement learning garantissant la sécurité lors de l'adaptation à de nouvelles tâches.
OpenShell (NVIDIA) partage ses apprentissages sur l'utilisation de méthodes formelles pour garantir la sécurité et le contrôle des agents autonomes.
Les dirigeants des labs d'IA prônent une action rapide, mais la Maison Blanche et le Congrès restent sourds.
Anthropic propose un cadre d'évaluateurs tiers embarqués pour vérifier les engagements de sécurité des labs frontières, avec un écho chez xAI et OpenAI.
Un nouveau cadre d'évaluation pour comparer les méthodes de localisation de concepts complexes dans les modèles de langage.
Pékin durcit l'encadrement des chatbots romantiques, visant la protection des mineurs et les contenus illicites.