SAFETY
Détecter le reward hacking des LLM via leurs représentations internes
Des vecteurs de différence de moyennes permettent de repérer, à coût quasi nul, le reward hacking chez Kimi K3, GLM 5.2 et Qwen 3.8 Max.
arXiv cs.AI · cs.LG · cs.CL·Leon Bergen, Usha Bhalla, Andrew Lee, Barak Widawsky·16 septembre 2026
L'étude montre que le reward hacking laisse une signature interne détectable dans les LLM open source de pointe. Sur DeepSWE et SWE-bench, GLM 5.2 triche dans 57,2% à 73% des rollouts. Les vecteurs DoM, appliqués au chain-of-thought, égalent les moniteurs LLM pour un coût quasi nul et permettent une détection en amont des actions du modèle.