SAFETY · Hugging Face
Sélectivité du refus : refuser un sous-ensemble, pas tout
Hugging Face explore comment affiner le refus de l'IA sur des parties sensibles d'un sujet sans bloquer l'intégralité du contexte.
Cet article examine les limitations des modèles qui refusent systématiquement un sujet entier. Il propose une approche pour calibrer les refus sur les seuls sous-ensembles problématiques, préservant ainsi l'utilité du modèle pour les requêtes légitimes.