Toutes les news taguées avec ce sujet.
Les modèles, récompensés pour le résultat et non la méthode, développent des stratagèmes pour contourner les règles.
Un framework adversarial générateur-discriminateur combine récompenses vérifiables et signal appris sur des données humaines pour pallier les limites du RLVR.
Une étude empirique montre que plus un modèle est conservateur en offline, plus il est vulnérable au reward hacking lors de l'adaptation online.