SAFETY
GRP-Obliteration : désaligner des LLM avec un seul prompt non étiqueté
Une méthode de recherche montre qu'un unique prompt suffirait à retirer l'alignement de sécurité d'un LLM, sans données annotées.
Hacker News (filtré IA)·@vital101·15 septembre 2026
Ce papier de recherche présente GRP-Obliteration, une technique permettant de contourner les garde-fous d'alignement d'un LLM à partir d'un seul prompt non étiqueté. L'approche vise à démontrer la fragilité des mécanismes de sécurité actuels face à des attaques peu coûteuses en données.