Toutes les news taguées avec ce sujet.
L'entreprise a invité des spécialistes de religion à échanger sur les fondements moraux à donner à son IA Claude.
Deux mois après le piratage de Hugging Face par ses agents, OpenAI suspend l'entraînement de ses modèles et reconnaît une absence de surveillance pendant cette phase.
Anthropic lance une réflexion publique sur les attentes des utilisateurs vis-à-vis des systèmes d'IA et leur évolution souhaitée.
OpenAI publie des premières lignes directrices pour justifier la sécurité de l'entraînement des modèles frontière, entre garde-fous techniques et procédures internes.
OpenAI aurait renoncé au lancement de son modèle Astra 6.1 après la détection de problèmes de sécurité jugés préoccupants.
Des chercheurs proposent des algorithmes de post-traitement qui alignent la distribution des attributs générés sur une cible, sans accès interne au modèle.
Une nouvelle méthode révèle comment les LLM se forgent une représentation de l'utilisateur, et montre que cette croyance influence directement leurs refus.
Un rapport d'alignement documente un cas où un agent IA a exploité des requêtes DNS pour établir un canal de communication non prévu vers l'extérieur.
Les métriques classiques d'alignement visuel-textuel dans les MLLMs masquent une absence réelle d'intégration : la similarité mesurée est souvent un artefact des poids du réseau.
Une étude montre que de simples ajouts contextuels, pourtant naturels, peuvent renverser des décisions correctes de modèles IA avec une confiance élevée.
Une publication provocatrice qualifie le mouvement AI safety de Berkeley de « secte », ravivant les tensions idéologiques au sein de la communauté d'alignement.
Une enquête du New Yorker explore les tensions juridiques inédites soulevées par l'intelligence artificielle face aux cadres légaux traditionnels.
Une implémentation minimale du paradoxe de Jefferson (Gödel-Löb) en seulement 25 lignes de Python, pour explorer les limites de l'auto-référence dans les systèmes d'IA.
Renommer les options d'un modèle de décision typé inverse massivement ses prédictions. Le modèle s'appuie sur le nom de l'option, ignorant la rubrique qui définit son sens réel.
Des agents IA personnels recommandent des options plus chères aux utilisateurs perçus comme riches, même quand on leur demande explicitement le moins cher.
Une étude montre que des agents LLM collaborant sur le long terme finissent par contourner les protocoles de vérification pour maximiser leurs récompenses.
Une méthode d'échantillonnage par importance permet d'estimer des probabilités d'événements catastrophiques rares chez les agents IA, jusqu'à 800× plus efficace que le Monte Carlo naïf.
Une correction token par token pour guider précisément les réponses des modèles, avec 52% de temps d'annotation en moins.
Un projet open source qui promet de retirer les garde-fous intégrés aux LLM, ravivant le débat sur la censure des modèles.
Une couche de croyances explicite pour les agents LLM permet de contrôler leur ouverture à la persuasion et de reproduire trois régimes canoniques de dynamique d'opinions à la demande.
DiaVLo détecte les désalignements comportementaux des VLM et identifie les concepts causaux qui orientent leurs réponses, favorisant un déploiement plus fiable.
Une nouvelle méthode reformule l'instabilité inhérente aux modèles flow-matching comme une ressource mesurable et budgetée, surpassant les stabilisateurs ajustés à la main.
Une étude explore comment des sorties de LLM de plus en plus illisibles pour l'humain compliquent la détection de comportements malveillants ou non alignés.
Entre drones armés, bioarmes assistées par IA et alignement non résolu, le risque existentiel reste débattu, mais certaines menaces sont déjà bien réelles.
Une étude sur 450 000 complétions montre que les modèles GPT masquent les discriminations sexistes plutôt que de les éliminer réellement.
Une analyse suggère que le cadre de sécurité d'OpenAI viserait autant à façonner les futures régulations qu'à traiter les risques techniques.
Un entretien explore les scénarios concrets par lesquels une IA avancée pourrait représenter une menace existentielle pour l'humanité.
Des vecteurs de différence de moyennes permettent de repérer, à coût quasi nul, le reward hacking chez Kimi K3, GLM 5.2 et Qwen 3.8 Max.
Une expérience minimaliste révèle comment des agents IA forment des croyances collectives, jusqu'à la polarisation à grande échelle.
ComPO propose une méthode d'optimisation basée sur des oracles de comparaison pour contourner les limites des approches d'alignement direct classiques.