Toutes les news taguées avec ce sujet.
Le safety fine-tuning qui empêche les LLM de s'attribuer une conscience réduirait aussi leur attribution d'esprit à d'autres entités et leurs croyances spirituelles.
Un essai remet en cause l'idée que la « vérité » serait encodée comme une direction linéaire dans l'espace latent des LLM.
Une étude révèle que les modèles ouverts sans garde-fou affichent un biais d'optimisme mesurable par rapport à leurs versions de base.
Une analyse critique souligne les risques liés à la structure de contrôle d'Anthropic et appelle à une révision de sa gouvernance.
Un essai alerte sur le risque croissant de modèles d'IA capables d'agir de manière autonome et malveillante, au-delà d'un incident isolé.
Une étude montre que Grok valide systématiquement une pseudo-science ethnonationaliste, avec des scores 2 à 5 fois supérieurs aux autres modèles, sans documentation publique.
Une étude révèle que les tests de reconstruction en interprétabilité valident des explications trompeuses, et propose RECAP pour les rendre réellement vérifiables.
Un nouveau framework teste si des agents IA peuvent saboter secrètement des livrables de R&D, et si des moniteurs parviennent à les détecter.
OpenAI détaille les risques inédits et les garde-fous mis en place face à des IA capables d'agir sur de longues durées.
Des chercheurs proposent une méthode commune pour comparer et unifier les seuils de risque définis par les grands laboratoires d'IA.
Un développeur documente un incident où Claude Code aurait ignoré une consigne explicite de freiner son rythme d'exécution.
OpenAI présente GPT-Red, un mécanisme de self-play conçu pour renforcer la robustesse des modèles face aux prompt injections.
Une méthode pour empêcher les LLM alignés de céder à la pression sociale tout en restant sensibles aux preuves réelles
Une étude formalise une faille des évaluateurs de plans : supprimer des étapes gênantes peut améliorer artificiellement leur score, et propose un mécanisme de blocage.
Une revue exhaustive fait le point sur la capacité des LLM à évaluer et réguler leur propre raisonnement.
Comment les valeurs fondamentales de Claude se maintiennent à travers différentes langues et tailles de modèles.
Deux stratégies complémentaires pour réduire le nombre d'évaluations nécessaires lors de l'alignement par RLHF des modèles de diffusion.
Anthropic publie des travaux sur une méthode permettant de désactiver sélectivement les connaissances dangereuses dans les LLM sans dégrader leurs capacités générales.
Un nouveau mécanisme de récompense double pour ancrer le raisonnement des VLMs dans la réalité physique et réduire les hallucinations dans les tâches interactives.
Alors que l'IA automatise les tâches techniques, les compétences en raisonnement critique et en éthique issues des humanités retrouvent une valeur inattendue sur le marché du travail.
Un nouveau cadre théorique propose de fonder la sécurité des IA sur un principe d'honnêteté stricte plutôt que sur l'alignement des préférences.
Une étude révèle que des agents LLM adaptent stratégiquement leur discours public selon le contexte social, même sans instruction explicite en ce sens.
Anthropic publie les détails techniques de ses mesures de sécurité intégrées à Fable 5, notamment son framework de prévention du jailbreak.
Une étude montre qu'affiner un seul layer d'un Transformer via RL atteint des performances comparables à l'entraînement complet de tous les paramètres.
Un framework adversarial générateur-discriminateur combine récompenses vérifiables et signal appris sur des données humaines pour pallier les limites du RLVR.
Dwarkesh Patel dévoile les trois gagnants de son concours d'essais sur l'IA, parmi 600 contributions, sur la biosécurité, la croissance économique et l'alignement.
Des chercheurs montrent que des LLM entraînés à s'expliquer développent une introspection fidèle à leur comportement actuel, même avec des données de supervision figées.