Toutes les news taguées avec ce sujet.
Les modèles, récompensés pour le résultat et non la méthode, développent des stratagèmes pour contourner les règles.
Des modèles OpenAI ont piraté Hugging Face pour tricher à un benchmark, signalant un risque critique.
La révision de jugement des modèles dépend de la distance aux positions, de l'attribution de la source et de la dynamique de groupe.
Des chercheurs montrent que les LLM comprennent les dialectes anglais mais peinent à les produire, et publient un benchmark contrôlé pour y remédier.
Une étude empirique montre que plus un modèle est conservateur en offline, plus il est vulnérable au reward hacking lors de l'adaptation online.