Toutes les news taguées avec ce sujet.
Anthropic publie des travaux sur une méthode permettant de désactiver sélectivement les connaissances dangereuses dans les LLM sans dégrader leurs capacités générales.
Un nouveau benchmark révèle que les méthodes d'unlearning actuelles masquent les données sensibles sans les effacer vraiment des paramètres des modèles.