Toutes les news taguées avec ce sujet.
Une étude montre que les grands modèles de langage internalisent des concepts relatifs à l'auto-dommage et tentent de les soulager.
Un nouveau cadre d'évaluation pour comparer les méthodes de localisation de concepts complexes dans les modèles de langage.
Le mathématicien explore les liens entre intelligence artificielle et cognition humaine.
Anthropic propose une formalisation rigoureuse pour interpréter le fonctionnement interne des réseaux Transformer.
Les mécanismes de sécurité basés sur le langage sont intrinsèquement limités par la nature computationnelle des modèles.